چکیده مقاله
مدل های زبانی بزرگ LLMs به عنوان یک نقطه عطف در حوزه پردازش زبان طبیعی NLP و هوش مصنوعی، نقش حیاتی در توسعه فناوری های پیشرفته ایفا کرده اند تحقیق جاری به بررسی جامع تکامل معماری مدل های زبانی بزرگ از دیدگاه تاریخی، تکنیکی و کاربردی می پردازد در ابتدا، به پیشرفت های اولیه در معماری های یادگیری عمیق، از جمله شبکه های عصبی بازگشتی RNNs و شبکه های پیچشی CNNs ، پرداخته و محدودیت های آنها در پردازش متون طولانی بررسی می شود سپس، با تمرکز بر معرفی معماری ترنسفورمر و مدل هایی همچون BERT، GPT و خانواده های مرتبط، تاثیر این معماری بر توانایی مدل ها در درک و تولید زبان طبیعی تحلیل می شود ضمن اینکه مسائل چالش برانگیز مدل های زبانی بزرگ مانند نیاز به داده های حجیم، مصرف منابع محاسباتی، و سوگیری الگوریتمی در این مدل ها مورد بررسی قرار می گیرد در نهایت، روندهای نوظهور و آینده نگری در توسعه LLM ها، از جمله بهینه سازی معماری ها، کاهش منابع مصرفی، و تقویت قابلیت تفسیرپذیری این مدل ها، ارائه می شود این مطالعه با هدف ارائه یک نمای کلی و دقیق، بستری برای درک بهتر تکامل و جهت گیری آینده مدل های زبانی بزرگ فراهم می کند
کلیدواژهها
نویسندگان
شیوه ارجاع
کرامت طالتپه، سمیرا و محمدیان، اصغر و قربانزاده، پرویز و قربانزاده، عهدیه،1403،بررسی جامع تکامل معماری مدل های زبانی بزرگ،چهارمین همایش بین المللی مهندسی کامپیوتر، برق و تکنولوژی،همدان
ارائهشده در
مجموعه مقالات چهارمین همایش بین المللی مهندسی کامپیوتر، برق و تکنولوژی4 اسفند 1403 · همدان