مهندس بيانات أول - PySpark وPython وCloudera (CDP)
نبذة عن الوظيفة
نحن نبحث عن مهندس بيانات كبير يتمتع بخبرة قوية في PySpark وPython وCloudera Data Platform (CDP) للانضمام إلى فريق هندسة البيانات عالي الأداء الذي يدعم مبادرات المنتجات الرقمية والمعاملات المصرفية على مستوى المؤسسة. سيكون لدى المرشح المثالي خبرة واسعة في تصميم وبناء وتحسين خطوط أنابيب البيانات واسعة النطاق ضمن النظم البيئية الحديثة للبيانات الضخمة. يتطلب هذا الدور خبرة فنية قوية في معالجة البيانات الموزعة ومنصات البيانات السحابية الأصلية وجودة البيانات وأفضل ممارسات هندسة بيانات المؤسسة. سيعمل المرشح الناجح بشكل وثيق مع مهندسي البيانات وعلماء البيانات وفرق التحليلات وأصحاب المنتجات وأصحاب المصلحة في الأعمال لتقديم حلول بيانات قابلة للتطوير وآمنة وعالية الأداء تدعم ذكاء الأعمال والتحليلات ومبادرات التعلم الآلي.
المتطلبات المسؤوليات الرئيسية • تصميم وتطوير وصيانة خطوط أنابيب البيانات عالية الأداء وقابلة للتطوير باستخدام PySpark وPython. • بناء حلول قوية لمعالجة البيانات المجمعة والموزعة باستخدام Cloudera Data Platform (CDP). • تطوير وتحسين خطوط أنابيب ETL/ELT لمجموعات بيانات المؤسسة المنظمة وغير المنظمة. • تصميم أطر عمل استيعاب البيانات قابلة للتطوير من مصادر بيانات المؤسسة المتعددة. • ضمان جودة البيانات العالية والنزاهة والحوكمة والتوافر عبر منصات المؤسسة. • أداء أنشطة تحديد ملامح البيانات والتطهير والتحويل والتحقق من الصحة. • تحسين وظائف Spark من حيث الأداء وقابلية التوسع واستخدام الموارد. • العمل بشكل وثيق مع علماء البيانات لإعداد مجموعات البيانات للتحليلات وحالات استخدام التعلم الآلي. • التعاون مع مالكي المنتجات، ومحللي الأعمال، والمهندسين المعماريين، وفرق الهندسة متعددة الوظائف. • مراقبة واستكشاف الأخطاء وإصلاحها وحل مشكلات خط أنابيب بيانات الإنتاج. • المشاركة في مراجعات التعليمات البرمجية وتنفيذ أفضل الممارسات الهندسية. • إنشاء الوثائق الفنية والحفاظ على معايير هندسة البيانات. • دعم التحسين المستمر لمنصات بيانات المؤسسة والعمليات الهندسية. • المشاركة في احتفالات Agile/Scrum بما في ذلك التخطيط لسباق السرعة، والاستمالة المتراكمة، والوقوف، والأحداث الاستعادية.
المهارات الفنية المطلوبة • 8-10+ سنوات من الخبرة في هندسة البيانات. • خبرة عملية قوية في لغة بايثون. • خبرة عملية قوية في PySpark. • خبرة واسعة مع Cloudera Data Platform (CDP). • فهم قوي لأطر معالجة البيانات الموزعة. • تجربة بناء خطوط أنابيب ETL/ELT على مستوى المؤسسة. • معرفة قوية بتقنيات البيانات الضخمة. • تجربة مع تقنيات النظام البيئي Hadoop. • برمجة SQL قوية ومهارات التحسين الاستعلام. • خبرة في نمذجة البيانات وتقنيات تحويل البيانات. • المعرفة بمبادئ جودة البيانات والتحقق من صحتها والحوكمة. • خبرة في العمل مع أنظمة Git والتحكم في الإصدار. • فهم ممارسات CI/CD لهندسة البيانات. • فهم قوي لواجهات برمجة تطبيقات REST وأنماط تكامل البيانات. • خبرة في العمل مع مجموعات البيانات المنظمة وشبه المنظمة وغير المنظمة.
جميل أن يكون • خبرة في العمل مع منصات البيانات السحابية الأصلية. • التعرض لخطوط أنابيب بيانات التعلم الآلي. • المعرفة بهندسة الميزات وإعداد البيانات لأحمال عمل AI/ML. • تجربة مع أدوات تنسيق سير العمل. • التعرض لتقنيات النقل بالحاويات مثل Docker وKubernetes. • خبرة في ممارسات DevOps لهندسة البيانات.
الكفاءات المطلوبة • مهارات تحليلية وحل المشكلات قوية. • مهارات الاتصال وإدارة أصحاب المصلحة ممتازة. • القدرة على العمل في بيئات التسليم سريعة الخطى. • عقلية ملكية قوية مع التركيز على الجودة والتسليم. • القدرة على التعاون بفعالية مع أصحاب المصلحة من رجال الأعمال والتقنية. • قدرات قوية على تصحيح الأخطاء وتحسين الأداء. • القدرة على إدارة أولويات متعددة وتقديمها ضمن جداول زمنية ضيقة.
تجربة المجال المفضل • الخدمات المصرفية • الخدمات المالية • المنتجات الرقمية • المعاملات المصرفية • منصات بيانات المؤسسة