چکیده مقاله
الگوریتم های یادگیری تقویتی عمیق DRL علی رغم موفقیت در حل مسائل پیچیده، در محیط های پویا با دو چالش اساسی «عدم پایداری در برابر تغییرات توزیع داده ها» و «ماهیت غیرشفاف تصمیم گیری» روبرو هستند این چالش ها مانع از به کارگیری آن ها در سیستم های حساس به امنیت می شود پژوهش حاضر با هدف رفع این محدودیت ها، یک چارچوب هیبریدی نوین ارائه می دهد که در آن لایه تصمیم گیری مبتنی بر الگوریتم بهینه PPO با یک ماژول تفسیرپذیر مفهوم محور Concept based ادغام شده است راهکار پیشنهادی با بهره گیری از تکنیک های تنظیم کننده Regularization برای پایداری و تحلیل نقشه های برجستگی Saliency Maps برای شفاف سازی، امکان تصمیم گیری تطبیقی را فراهم می کند ارزیابی های تجربی در محیط های شبیه سازی پویا نشان می دهد که مدل پیشنهادی به دقت ۹۶ ۴٪ در اجرای سیاست های بهینه دست یافته و در مقایسه با مدل های پایه Baseline مانند SAC و DQN، پایداری عملکرد را تا ۱۸٪ در محیط های نویزی افزایش داده است همچنین، نتایج نشان دهنده بهبود ۱۴ درصدی در شاخص وفاداری Fidelity توضیحات نسبت به متدهای پس ینی Post hoc متداول است این نتایج تایید می کند که چارچوب پیشنهادی تعادلی بهینه میان عملکرد فنی و تفسیرپذیری انسانی برقرار کرده است
کلیدواژهها
نویسندگان
شیوه ارجاع
ملایی، امین علی و ملاخلیلی میبدی، محمد رضا،1405،ارائه ی چارچوبی تفسیرپذیر و پایدار مبتنی بر یادگیری تقویتی عمیق برای تصمیم گیری تطبیقی در محیط های پویا،سی امین کنفرانس ملی علوم و مهندسی کامپیوتر و فناوری اطلاعات،بابل
ارائهشده در
مجموعه مقالات سی امین کنفرانس ملی علوم و مهندسی کامپیوتر و فناوری اطلاعات29 مرداد 1405 · بابل