مقاله کنفرانسی سال ۱۴۰۴ انگلیسی

Document Clustering Using Deep Pre-trained Language Model Embeddings for Information Retrieval

Document Clustering Using Deep Pre-trained Language Model Embeddings for Information Retrieval

چکیده مقاله

Document clustering is critical to information retrieval IR as it enhances user navigation, semantic organization, and exploration of large text collections Current clustering techniques, though, are marred by poor accuracy and semantic inconsistency, with many misclassifying relevant documents as noise and using superficial textual representations This study aims to develop a clustering pipeline that produces semantically meaningful and structurally coherent groups of documents to support more effective IR We propose a method that combines SBERT embeddings for deep semantic representation, UMAP for structure preserving dimensionality reduction, and HDBSCAN for flexible, density based clustering without needing to predefine the number of clusters Experimental evaluations on the 20 Newsgroups dataset reveal that our optimal setting with the paraphrase mpnet base v2 model obtains a Silhouette Score of 0 6853, ARI of 0 7865, and NMI of 0 8186 These results illustrate the promise of embedding based clustering methods to greatly improve the interpretability and effectiveness of IR systems on real world text collections

کلیدواژه‌ها

SBERT UMAP HDBSCAN Document Clustering Information Retrieval

نویسندگان

تصویر Mahdi Mohammadiha

Mahdi Mohammadiha

Department of Computer Engineering, Faculty of Engineering, International University of Imam Khomeini, Qazvin, Iran

تصویر Mohammad Hassan Sadreddini

Mohammad Hassan Sadreddini

Department of Computer Engineering, Faculty of Engineering, International University of Imam Khomeini, Qazvin, Iran

تصویر Morteza Mohammadi Zanjireh

Morteza Mohammadi Zanjireh

Department of Computer Engineering, Faculty of Engineering, International University of Imam Khomeini, Qazvin, Iran

شیوه ارجاع

Mohammadiha, Mahdi and Sadreddini, Mohammad Hassan and Mohammadi Zanjireh, Morteza,1404,Document Clustering Using Deep Pre-trained Language Model Embeddings for Information Retrieval,The Second National Conference on the Era of Technology Explosion: Artificial Intelligence, a Transformation in Industry, Trade, and Supply Chain,Tabriz

ارائه‌شده در

پوستر مجموعه مقالات دومین کنفرانس ملی عصر انفجار تکنولوژی؛ هوش مصنوعی، تحولی در صنعت، تجارت و زنجیره تامین مجموعه مقالات دومین کنفرانس ملی عصر انفجار تکنولوژی؛ هوش مصنوعی، تحولی در صنعت، تجارت و زنجیره تامین17 مهر 1404 · تبریز
ادامه مسیر پژوهش

مقالات مرتبط

مقاله کنفرانسی سال ۱۴۰۴ ۴۴۰ مشاهده

جایگاه هوش مصنوعی در آینده اقتصاد ایران

هوش مصنوعی مجموعه ای از فناوری هایی است که ماشین را قادر می سازد با تقلید از توانایی های انسانی از قبیل…

هوش مصنوعیاقتصاد ایران
مقاله کنفرانسی سال ۱۴۰۴ ۳۸۶ مشاهده

هوش مصنوعی در خودروهای خودران چالش ها و راهکارهای تصمیم گیری

با گسترش روزافزون فناوری های هوش مصنوعی به ویژه در حوزه یادگیری عمیق و بینایی ماشین، خودروهای خودران به…

هوش مصنوعیادراک محیطبینایی ماشین
مقاله کنفرانسی سال ۱۴۰۴ ۳۳۷ مشاهده

مروری بر روشهای هوشمند تشخیص نفوذ در اینترنت اشیاء با تاکید بر یادگیری ماشین و الگوریتم های بهینه سازی

ایران با رشد چشمگیر فناوری اینترنت اشیاء و کاربردهای گسترده آن در حوزه های مختلف نظیر، سلامت، حمل و نقل…

تشخیص نفوذیادگیری ماشیناینترنت اشیا
مقاله کنفرانسی سال ۱۴۰۴ ۳۱۳ مشاهده

بررسی کاربرد و چالش های هوش مصنوعی در مدیریت لجستیک بنادر

با رشد سریع تجارت جهانی و پیچیدگی روزافزون زنجیره های تامین، بنادر به عنوان گلوگاه های حیاتی در شبکه حمل…

هوش مصنوعیبنادر هوشمندلجستیک بندری
مقاله کنفرانسی سال ۱۴۰۴ ۳۰۸ مشاهده

بهره گیری از هوش مصنوعی و یادگیری عمیق در پیش بینی خطا و عیب یابی تجهیزات صنعتی

با پیشرفت فناوری و پیچیدگی فزاینده سیستم های صنعتی در چارچوب انقلاب صنعتی چهارم، نیاز به روش های سریع، د…

هوش مصنوعییادگیری عمیقانقلاب صنعتی چهارم
مقاله کنفرانسی سال ۱۴۰۴ ۲۹۹ مشاهده

نقشه راه آموزش هوش مصنوعی در ایران از بومی سازی تا جهانی سازی

رشد شتابان فناوری های هوش مصنوعی نیازمند بازطراحی بنیادین در ساختارهای آموزشی و تربیت نیروی انسانی متخصص…

آموزش پژوهش محوراستانداردهای ملی آموزشینقشه راه آموزشی هوش مصنوعی