چکیده مقاله
با رشد سریع و نمایی داده ها در حوزه های مختلف، انتخاب الگوریتم و ابزار مناسب برای پردازش و تحلیل کلان داده ها اهمیت ویژه ای یافته است مطالعات مختلف به بررسی و مقایسه الگوریتم های طبقه بندی رایج مانند Naive Bayes، KNN، درخت تصمیم، جنگل تصادفی، شبکه های عصبی مصنوعی و SVM پرداخته اند نتایج نشان می دهد که جنگل تصادفی و شبکه های عصبی معمولا دقت بالاتری دارند، در حالی که KNN سرعت بیشتری ارائه می دهد و SVM در برخی شرایط تعادلی میان دقت و سرعت برقرار می کند یکی از چالش های مهم در این حوزه، وجود داده های نامتعادل است که باعث کاهش کارایی الگوریتم های استاندارد می شود برای رفع این مشکل، روش های مختلفی مانند نمونه افزایی، نمونه برداری، الگوریتم های حساس به هزینه و روش های تلفیقی Boosting و Bagging پیشنهاد شده اند همچنین رویکردهای نوینی مانند SplitBal توانسته اند بدون حذف یا تولید داده های اضافی، داده ها را متوازن کرده و عملکرد طبقه بندی را بهبود دهند از سوی دیگر، محیط های پردازشی توزیع شده مانند Spark و Hadoop نقش مهمی در مدیریت داده های حجیم دارند ارزیابی الگوریتم ها در این محیط ها نشان داده است که دقت طبقه بندی بالا باقی می ماند، اما سرعت و کارایی به تعداد گره ها و حجم داده وابسته است علاوه بر این، استفاده از الگوریتم های ژنتیک برای رمزگذاری و خوشه بندی داده ها در اکوسیستم هادوپ توانسته مقیاس پذیری و بهره وری منابع را ارتقا دهد در مجموع، این پژوهش ها بیانگر آن اند که ترکیب انتخاب درست الگوریتم های یادگیری ماشین، استفاده از روش های متعادل سازی داده و بهره گیری از زیرساخت های پردازش توزیع شده می تواند راهکار موثری برای تحلیل کلان داده های پیچیده و نامتعادل باشد
کلیدواژهها
نویسندگان
شیوه ارجاع
وحدانی، مریم و خاندوزی قلی آباد، نساء،1405،بررسی مقایسه الگوریتم های طبقه بندی در داده های حجیم،بیست و نهمین کنفرانس ملی علوم و مهندسی کامپیوتر و فناوری اطلاعات،بابل
ارائهشده در
مجموعه مقالات بیست و نهمین کنفرانس ملی علوم و مهندسی کامپیوتر و فناوری اطلاعات27 فروردین 1405 · بابل