چکیده مقاله
معماری ترکیب متخصصان MoE با فعال سازی شرطی پارامترها، به عنوان پارادایم غالب برای مقیاس پذیری مدل های زبانی بزرگ LLMs و دستیابی به عملکردی فراتر از مدل های چگال با هزینه محاسباتی کمتر ظهور کرده است با این حال، پیاده سازی کارآمد این معماری ها در مقیاس بزرگ با چالش های سه گانه شامل: ناپایداری در آموزش، گلوگاه های ارتباطی و سربار حافظه در زمان استنتاج مواجه است این مقاله مروری، با استناد به تحقیقات سال های ۲۰۲۳ تا ۲۰۲۵، یک طبقه بندی جامع از راهکارها ارائه می دهد ما پیشرفت ها را در سه سطح بررسی می کنیم: ۱ نوآوری های معماری نظیر مسیریابی نرم و ادغام با مدل های فضای حالت، ۲ بهینه سازی سیستم شامل همپوشانی ارتباطات و چارچوب های آموزشی تطبیقی و ۳ تکنیک های استنتاج و فشرده سازی که اجرای مدل های تریلیونی را بر روی سخت افزارهای مصرف کننده ممکن می سازند تحلیل ما نشان می دهد که مسیر پژوهش از صرفه جویی در محاسبات، به سمت “تخصصی سازی پایدار” و “دموکراتیزه کردن استنتاج” تغییر جهت داده است
کلیدواژهها
نویسندگان
شیوه ارجاع
�رویدیان، محسن و غیاث آبادی فراهانی، منصوره و تقی پور، سارا،1404،استراتژی های موازی سازی در معماری های ترکیب متخصصان (MoE) برای مدل های زبانی بزرگ: چالش های ارتباطی و تعادل بار،چهارمین کنفرانس بین المللی و نهمین کنفرانس ملی کامپیوتر، فناوری اطلاعات و کاربردهای هوش مصنوعی،اهواز
ارائهشده در
مجموعه مقالات پنجمین همایش ملی و نخستین همایش بین المللی محاسبات نرم علوم مهندسی در صنعت و جامعه26 بهمن 1404 · ایرانشهر