چکیده مقاله
در عصر حاضر، مشابهت یابی معنایی Semantic Similarity به عنوان یکی از ارکان مهم پردازش زبان طبیعی NLP می باشد این فناوری با تحلیل ارتباط معنایی بین متون، کاربردهای گسترده ای در جستجوی هوشمند، رده بندی و خوشه بندی متون، سامانه های پیشنهاددهنده محتوا Recommender System ، شناسایی سرقت علمی، سامانه های پرسش و پاسخ و بازیابی اطلاعات دارد با ظهور مدل های زبانی بزرگ LLMs مانند BERT، Mistral و GPT، دقت مشابهت یابی به سطح بی سابقه ای رسیده است، منظور از شباهت یابی معنایی، محاسبه میزان شباهت معنایی بین دو سند متنی، پاراگراف یا جمله می باشد که غالبا با استخراج بردارهای تعبیه Embedding vectors از هر دو سند و مقایسه میزان فاصله زاویه ای بین دو بردار اندازه گیری می شود چالش هایی مانند پردازش متون طولانی، محاسبات سنگین و افت عملکرد در حوزه های تخصصی همچنان پابرجاست از طرفی یافتن یک بازنمایی معنایی غنی با ابعاد کم برای متون طولانی یکی از چالش های اساسی دیگر در این زمینه می باشد یک بازنمایی دقیق باید اطلاعات معنایی و نحوی متن و هم ارتباط بین متون را در ابعاد کمینه متناسب با وظیفه مدنظر، مدل سازی کند مدل های مانند Longformer که برای پردازش متون طولانی طراحی شده اند نیاز به آموزش و حجم قابل توجهی داده برای تنظیم دقیق دارند و عملا در حوزه های خاص و بدون داده برچسب دار کافی، کارایی لازم را ندارند در این مقاله روش جدیدی با نام تولید بردار تعبیه با پنجره کشویی به منظور تعبیه متون طولانی پیشنهاد شده و تلاش شده تا کارایی روش پیشنهادی با سایر روش ها مقایسه شود
کلیدواژهها
نویسندگان
شیوه ارجاع
�لدار، حسن و همایون پور، محمدمهدی،1404،تعبیه متون طولانی با پنجره کشویی با استفاده از مدل های زبانی بزرگ،اولین همایش علوم اسلامی و انسانی دیجیتال،قم
ارائهشده در
مجموعه مقالات اولین همایش علوم اسلامی و انسانی دیجیتال17 مهر 1404 · قم