ویژگیهای کلیدی
● شرح Hadoop، YARN، MapReduce و Tez برای درک پردازش داده توزیعشده و مدیریت منابع.
● بررسی عمیق نقش Apache Hive و Apache Spark در انبار داده، پردازش بیدرنگ و تحلیلهای پیشرفته.
● ارائه راهنمایی عملی برای استفاده از Python با Hadoop برای هوش تجاری و تحلیل داده.
توضیحات کتاب
در بازار کار دادههای حجیم که به سرعت در حال تحول است و پیشبینی میشود تا سال ۲۰۲۶، ۲۸ درصد رشد داشته باشد و حقوقها تا ۱۵۰۰۰۰ دلار در سال برسد، تسلط بر تحلیل دادههای حجیم با اکوسیستم Hadoop، پرطرفدارترین عامل برای پیشرفت شغلی است. کتاب “تحلیل نهایی دادههای حجیم با Apache Hadoop” یک همراه ضروری است که دانش عمیق و مهارتهای عملی مورد نیاز برای برتری در چشمانداز دادهمحور امروزی را ارائه میدهد.
این کتاب با ایجاد یک پایه قوی با مروری بر دریاچههای داده، انبارهای داده و مفاهیم مرتبط آغاز میشود. سپس به اجزای اصلی Hadoop مانند HDFS، YARN، MapReduce و Apache Tez میپردازد و ترکیبی از تئوری و تمرینهای عملی را ارائه میدهد.
شما تجربه عملی با موتورهای پرسوجو مانند Apache Hive و Apache Spark و همچنین فرمتهای فایل و جدول مانند ORC، Parquet، Avro، Iceberg، Hudi و Delta به دست خواهید آورد. دستورالعملهای مفصلی در مورد نصب و پیکربندی خوشهها با Docker گنجانده شده است، به همراه تجسم دادههای حجیم و تحلیل آماری با استفاده از Python.
با توجه به اهمیت روزافزون خطوط لوله داده مقیاسپذیر، این کتاب مهندسان داده، تحلیلگران و متخصصان دادههای حجیم را به مهارتهای عملی برای راهاندازی، مدیریت و بهینهسازی خطوط لوله داده و استفاده موثر از تکنیکهای یادگیری ماشین مجهز میکند.
فرصت تبدیل شدن به یک رهبر در زمینه دادههای حجیم را از دست ندهید تا پتانسیل کامل تحلیل دادههای حجیم با Hadoop را آزاد کنید.
آنچه خواهید آموخت
● کسب تخصص در ساخت و مدیریت خطوط لوله داده در مقیاس بزرگ با Hadoop، YARN و MapReduce.
● تسلط بر تحلیل بیدرنگ و پردازش داده با ویژگیهای قدرتمند Apache Spark.
● توسعه مهارتها در استفاده از Apache Hive برای انبار داده کارآمد و پرسوجوهای پیچیده.
● ادغام Python برای تحلیل داده پیشرفته، تجسم و هوش تجاری در اکوسیستم Hadoop.
● یادگیری نحوه بهبود ذخیرهسازی داده و عملکرد پردازش با استفاده از فرمتهایی مانند ORC، Parquet و Delta.
● کسب تجربه عملی در استقرار و مدیریت خوشههای Hadoop با Docker و Kubernetes.
● ساخت و استقرار مدلهای یادگیری ماشین با ابزارهای یکپارچه شده در اکوسیستم Hadoop.
فهرست مطالب
۱. مقدمه ای بر Hadoop و ASF
۲. مروری بر تحلیل دادههای حجیم
۳. Hadoop و YARN MapReduce و Tez
۴. موتورهای پرسوجوی توزیعشده: Apache Hive
۵. موتورهای پرسوجوی توزیعشده: Apache Spark
۶. فرمتهای فایل و فرمتهای جدول (Apache Ice-berg، Hudi و Delta)
۷. Python و اکوسیستم Hadoop برای تحلیل دادههای حجیم – BI
۸. علم داده و یادگیری ماشین با اکوسیستم Hadoop
۹. مقدمهای بر رایانش ابری و سایر پروژههای Apache
نمایه