چکیده مقاله
با گسترش سریع فناوری های دیجیتال و افزایش تولید داده از منابع متنوعی چون دستگاه های IoT، رسانه های اجتماعی، سامانه های تجاری و اطلاعات مکانی، نیاز به بسترهایی جهت پردازش و تحلیل داده های حجیم با سرعت و دقت بالا بیش از پیش احساس می شود Apache Spark به عنوان یکی از ابزارهای نوین پردازش داده های بزرگ، با قابلیت پردازش موازی و درون حافظه ای، امکانات بی نظیری برای تحلیل داده های ساخت یافته، نیمه ساخت یافته و جریانی فراهم می سازد در این مقاله، یک چارچوب تحلیلی نوآورانه مبتنی بر Apache Spark ارائه شده که هدف آن ارزیابی کارایی این پلتفرم در تحلیل داده های حجیم در شرایط واقعی و مقایسه آن با دیگر ابزارهای تحلیل داده همچون Dask و Flink است روش تحقیق شامل طراحی چند سناریوی عملی با بهره گیری از داده های واقعی و شبه واقعی، استفاده از الگوریتم های یادگیری ماشین موجود در Spark MLlib، و به کارگیری ساختارهای توزیع شده برای ارزیابی معیارهایی چون زمان اجرا، میزان مصرف حافظه، توان مقیاس پذیری، و دقت تحلیل می باشد همچنین با تنظیم دقیق پارامترهایی همچون تعداد پارتیشن ها، نوع caching و تنظیمات حافظه، کارایی Spark در وضعیت های مختلف مورد بررسی قرار گرفته است نتایج حاصل از اجرای سناریوها نشان می دهند که Spark قادر است در پردازش داده های حجیم عملکردی قابل توجه از نظر سرعت، مقیاس پذیری و دقت ارائه دهد و با انجام بهینه سازی های مناسب، بر محدودیت های شناخته شده غلبه کند نوآوری اصلی مقاله ارائه مدلی پویا و قابل تطبیق برای تنظیم عملکرد Spark در پروژه های تحلیل داده در مقیاس های بالا است که می تواند به عنوان الگویی برای توسعه سامانه های تحلیلی آینده مورد استفاده قرار گیرد
کلیدواژهها
نویسندگان
شیوه ارجاع
نیک رو، سهیل،1404،تحلیل داده های حجیم با استفاده از Apache Spark،بیست و ششمین کنفرانس ملی مهندسی برق،کامپیوتر و مکانیک،شیروان
ارائهشده در
مجموعه مقالات بیست و ششمین کنفرانس ملی مهندسی برق،کامپیوتر و مکانیک20 خرداد 1404 · شیروان