چکیده مقاله
با گسترش تعاملات انسان و رایانه در حوزه هایی نظیر آموزش مجازی، خدمات درمانی هوشمند و ربات های اجتماعی، نیاز به درک دقیق احساسات انسانی از سوی سامانه های هوش مصنوعی به یک ضرورت تبدیل شده است تشخیص احساسات چندوجهی که ترکیبی از اطلاعات بصری چهره و صوتی بیان گفتاری را مورد استفاده قرار می دهد، رویکردی پیشرفته و دقیق برای شناخت وضعیت هیجانی کاربران ارائه می دهد در این پژوهش یک سیستم تشخیص احساسات چندوجهی مبتنی بر ادغام ویژگی های صوتی و تصویری با استفاده از معماری های مدرن مبتنی بر ترنسفورمر طراحی و پیاده سازی شد مسیر صوتی با استفاده از مدل پیش آموزش دیده و مسیر تصویری از طریق مدل مبدل تصویری ViT استخراج شد و در نهایت، اطلاعات دو کانال ورودی با سازوکار توجه متقابل در یک شبکه ترنسفورمری چندوجهی تلفیق شدند مدل پیشنهادی روی سه پایگاه داده معتبر شامل RAVDESS، JEMOCAP و MELD مورد آموزش و ارزیابی قرار گرفت نتایج نشان داد که سیستم پیشنهادی در مقایسه با مدل های تک وجهی و حتی برخی روش های پیشرفته موجود از دقت بالاتر میانگین بیش از ۹۰ و عملکرد پایدارتر برخوردار است تحلیل نگاشت های توجه نیز نشان داد که مدل به درستی شاخص های کلیدی صوتی و تصویری را شناسایی و ترکیب می کند مزیت اصلی مدل توانایی درک احساسی دقیق تر در شرایط واقعی، هم زمانی بهینه بین کانال های اطلاعاتی و قابلیت تعمیم به محیط های تعاملی مختلف است یافته ها نشان دهنده ظرفیت بالای استفاده از ترنسفورمرهای چندوجهی در کاربردهای احساسی هوش مصنوعی بوده و مسیر توسعه سیستم های انسان محور آینده را هموارتر می سازد
کلیدواژهها
نویسندگان
شیوه ارجاع
�دالتی، مجید،1404،سیستم تشخیص احساسات چندوجهی مبتنی بر ادغام ویژگی های صوتی و تصویری با استفاده از معماری های پیشرفته ترنسفورمری در کاربردهای تعامل انسان و رایانه،هشتمین کنفرانس بین المللی هوش مصنوعی و چشم انداز آینده آن در علوم مهندسی برق ، کامپیوتر ، مکانیک و مخابرات،مشهد
ارائهشده در
مجموعه مقالات هشتمین کنفرانس بین المللی هوش مصنوعی و چشم انداز آینده آن در علوم مهندسی برق ، کامپیوتر ، مکانیک و مخابرات5 آذر 1404 · مشهد