چکیده مقاله
با گسترش روزافزون شبکه های آنلاین و افزایش حجم محتوای تولید شده توسط کاربران، پدیده هرزنامه Spam به یکی از چالش های مهم این فضا تبدیل شده است وجود پیام های ناخواسته و تبلیغاتی علاوه بر کاهش کیفیت تجربه کاربری می تواند تهدیدات امنیتی و اطلاعاتی متعددی را نیز به همراه داشته باشد از این رو، ارائه روش های هوشمند و خودکار برای تشخیص هرزنامه از اهمیت بالایی برخوردار است در این پژوهش، یک رویکرد مبتنی بر داده کاوی و یادگیری ماشین برای تشخیص هرزنامه در شبکه های آنلاین ارائه شده است برای ارزیابی روش پیشنهادی از مجموعه داده واقعی YouTube Spam Collection شامل نظرات کاربران یوتیوب استفاده شده است در مرحله پیش پردازش، عملیات پاک سازی، حذف کلمات توقف، نرمال سازی و استخراج ویژگی با استفاده از روش TF IDF انجام شده و سپس الگوریتم های Linear Support Vector, Logistic Regression, Multinomial Naive Bayes Classifier برای طبقه بندی نظرات به دو کلاس هرزنامه و غیر هرزنامه به کار گرفته شده اند نتایج آزمایش ها نشان می دهد که الگوریتم Logistic Regression با ایجاد بهترین تعادل میان معیارهای دقت، بازخوانی و F۱ score، عملکرد بهتری نسبت به سایر مدل ها داشته و رویکرد پیشنهادی از کارایی مناسبی برای استفاده در سامانه های تشخیص خودکار هرزنامه برخوردار است
کلیدواژهها
نویسندگان
شیوه ارجاع
�هره مند، زهرا و امیری، علیرضا،1404،ارائه یک رویکرد مبتنی بر داده کاوی جهت تشخیص هرزنامه در شبکه های آنلاین،دومین کنفرانس بین المللی دو سالانه پیشرفت ها در هوش مصنوعی و علوم داده،بوشهر
ارائهشده در
همایش «بسیج، پیشرفت و امنیت پایدار در منطقه جنوب شرق کشور»7 بهمن 1404 · تهران