Tabbio
تسجيل الدخول إلى التطبيق
قبل 3 أيام

مهندس بيانات أول - PySpark وPython وCloudera (CDP)

GSSTech Group · Dubai, United Arab Emirates
Workableقدّم عبر موقع الشركة
Onsite
Senior

نبذة عن الوظيفة

نحن نبحث عن مهندس بيانات كبير يتمتع بخبرة قوية في PySpark وPython وCloudera Data Platform (CDP) للانضمام إلى فريق هندسة البيانات عالي الأداء الذي يدعم مبادرات المنتجات الرقمية والمعاملات المصرفية على مستوى المؤسسة. سيكون لدى المرشح المثالي خبرة واسعة في تصميم وبناء وتحسين خطوط أنابيب البيانات واسعة النطاق ضمن النظم البيئية الحديثة للبيانات الضخمة. يتطلب هذا الدور خبرة فنية قوية في معالجة البيانات الموزعة ومنصات البيانات السحابية الأصلية وجودة البيانات وأفضل ممارسات هندسة بيانات المؤسسة. سيعمل المرشح الناجح بشكل وثيق مع مهندسي البيانات وعلماء البيانات وفرق التحليلات وأصحاب المنتجات وأصحاب المصلحة في الأعمال لتقديم حلول بيانات قابلة للتطوير وآمنة وعالية الأداء تدعم ذكاء الأعمال والتحليلات ومبادرات التعلم الآلي.

المتطلبات المسؤوليات الرئيسية • تصميم وتطوير وصيانة خطوط أنابيب البيانات عالية الأداء وقابلة للتطوير باستخدام PySpark وPython. • بناء حلول قوية لمعالجة البيانات المجمعة والموزعة باستخدام Cloudera Data Platform (CDP). • تطوير وتحسين خطوط أنابيب ETL/ELT لمجموعات بيانات المؤسسة المنظمة وغير المنظمة. • تصميم أطر عمل استيعاب البيانات قابلة للتطوير من مصادر بيانات المؤسسة المتعددة. • ضمان جودة البيانات العالية والنزاهة والحوكمة والتوافر عبر منصات المؤسسة. • أداء أنشطة تحديد ملامح البيانات والتطهير والتحويل والتحقق من الصحة. • تحسين وظائف Spark من حيث الأداء وقابلية التوسع واستخدام الموارد. • العمل بشكل وثيق مع علماء البيانات لإعداد مجموعات البيانات للتحليلات وحالات استخدام التعلم الآلي. • التعاون مع مالكي المنتجات، ومحللي الأعمال، والمهندسين المعماريين، وفرق الهندسة متعددة الوظائف. • مراقبة واستكشاف الأخطاء وإصلاحها وحل مشكلات خط أنابيب بيانات الإنتاج. • المشاركة في مراجعات التعليمات البرمجية وتنفيذ أفضل الممارسات الهندسية. • إنشاء الوثائق الفنية والحفاظ على معايير هندسة البيانات. • دعم التحسين المستمر لمنصات بيانات المؤسسة والعمليات الهندسية. • المشاركة في احتفالات Agile/Scrum بما في ذلك التخطيط لسباق السرعة، والاستمالة المتراكمة، والوقوف، والأحداث الاستعادية.

المهارات الفنية المطلوبة • 8-10+ سنوات من الخبرة في هندسة البيانات. • خبرة عملية قوية في لغة بايثون. • خبرة عملية قوية في PySpark. • خبرة واسعة مع Cloudera Data Platform (CDP). • فهم قوي لأطر معالجة البيانات الموزعة. • تجربة بناء خطوط أنابيب ETL/ELT على مستوى المؤسسة. • معرفة قوية بتقنيات البيانات الضخمة. • تجربة مع تقنيات النظام البيئي Hadoop. • برمجة SQL قوية ومهارات التحسين الاستعلام. • خبرة في نمذجة البيانات وتقنيات تحويل البيانات. • المعرفة بمبادئ جودة البيانات والتحقق من صحتها والحوكمة. • خبرة في العمل مع أنظمة Git والتحكم في الإصدار. • فهم ممارسات CI/CD لهندسة البيانات. • فهم قوي لواجهات برمجة تطبيقات REST وأنماط تكامل البيانات. • خبرة في العمل مع مجموعات البيانات المنظمة وشبه المنظمة وغير المنظمة.

جميل أن يكون • خبرة في العمل مع منصات البيانات السحابية الأصلية. • التعرض لخطوط أنابيب بيانات التعلم الآلي. • المعرفة بهندسة الميزات وإعداد البيانات لأحمال عمل AI/ML. • تجربة مع أدوات تنسيق سير العمل. • التعرض لتقنيات النقل بالحاويات مثل Docker وKubernetes. • خبرة في ممارسات DevOps لهندسة البيانات.

الكفاءات المطلوبة • مهارات تحليلية وحل المشكلات قوية. • مهارات الاتصال وإدارة أصحاب المصلحة ممتازة. • القدرة على العمل في بيئات التسليم سريعة الخطى. • عقلية ملكية قوية مع التركيز على الجودة والتسليم. • القدرة على التعاون بفعالية مع أصحاب المصلحة من رجال الأعمال والتقنية. • قدرات قوية على تصحيح الأخطاء وتحسين الأداء. • القدرة على إدارة أولويات متعددة وتقديمها ضمن جداول زمنية ضيقة.

تجربة المجال المفضل • الخدمات المصرفية • الخدمات المالية • المنتجات الرقمية • المعاملات المصرفية • منصات بيانات المؤسسة

المتطلبات

1Design, Develop, And Maintain Scalable, High Performance Data Pipelines Using PySpark And Python .
2Build Robust Batch And Distributed Data Processing Solutions Using Cloudera Data Platform (CDP) .
3Develop And Optimize ETL/ELT Pipelines For Structured And Unstructured Enterprise Datasets.
4Design Scalable Data Ingestion Frameworks From Multiple Enterprise Data Sources.
5Ensure High Data Quality, Integrity, Governance, And Availability Across Enterprise Platforms.
6Perform Data Profiling, Cleansing, Transformation, And Validation Activities.
7Optimize Spark Jobs For Performance, Scalability, And Resource Utilization.
8Work Closely With Data Scientists To Prepare Datasets For Analytics And Machine Learning Use Cases.
9Collaborate With Product Owners, Business Analysts, Architects, And Cross Functional Engineering Teams.
10Monitor, Troubleshoot, And Resolve Production Data Pipeline Issues.
11Participate In Code Reviews And Implement Engineering Best Practices.
12Create Technical Documentation And Maintain Data Engineering Standards.
13Support Continuous Improvement Of Enterprise Data Platforms And Engineering Processes.
14Participate In Agile/Scrum Ceremonies Including Sprint Planning, Backlog Grooming, Stand Ups, And Retrospectives.

المهارات والوسوم

AEPythonSQLDockerKubernetesDevOpsMachine LearningAgileScrumBankingData AnalysisCompliance
قدّم على هذه الوظيفة

احجز رابط tabbio
قبل أن يُحجز