أمس
مهندس بيانات أول
Devsinc · Riyadh, Riyadh Province, Saudi Arabia
Workableقدّم عبر موقع الشركة
Full Time
Onsite
Senior
نبذة عن الوظيفة
تبحث Devsinc عن مهندس بيانات كبير يتمتع بمهارات عالية ويتمتع بخبرة مهنية تتراوح من 4 إلى 6 سنوات لتصميم وبناء وصيانة خطوط أنابيب بيانات قابلة للتطوير وأنظمة معالجة تدعم التحليلات ومنتجات البيانات وقدرات الذكاء الاصطناعي/التعلم الآلي. سيكون لدى المرشح المثالي خبرة عملية قوية مع خطوط أنابيب ETL/ELT وPython وSQL وApache Airflow وApache Spark وRedis، إلى جانب القدرة على تطوير مسارات عمل موثوقة وقابلة للصيانة لمجموعات البيانات الكبيرة والمعقدة والمتنامية باستمرار. ستتعاون مع فرق المنتجات وذكاء الأعمال وعلوم البيانات والهندسة لتقديم مجموعات بيانات جاهزة للإنتاج وحلول بيانات عالية الأداء.
المسؤوليات
- تصميم وتطوير وصيانة خطوط أنابيب ETL/ELT قابلة للتطوير لاستيعاب البيانات وتحويلها والتحقق من صحتها وتسليمها.
- إنشاء وجدولة وتنسيق عمليات سير عمل البيانات على مستوى الإنتاج باستخدام Apache Airflow.
- تطوير وظائف معالجة البيانات الموزعة باستخدام Apache Spark.
- كتابة كود Python الفعال والقابل لإعادة الاستخدام والقابل للصيانة لمعالجة البيانات والأتمتة وتطوير خطوط الأنابيب.
- تطوير وتحسين استعلامات SQL المعقدة لتحويل البيانات وتحليلها والتحقق من الجودة.
- تصميم خطوط أنابيب قادرة على معالجة مجموعات البيانات المنظمة وشبه المنظمة وغير المنظمة واسعة النطاق.
- تنفيذ Redis للتخزين المؤقت، والوصول إلى البيانات عالية الأداء، ومتطلبات التطبيقات كثيفة البيانات.
- دمج البيانات من واجهات برمجة التطبيقات (APIs)، وقواعد البيانات العلائقية، والملفات، وموفري الجهات الخارجية، والمصادر الداخلية والخارجية الأخرى.
- تنفيذ التحقق من صحة البيانات، والرصد، والتسجيل، ومعالجة الأخطاء، والتنبيه، وإمكانية ملاحظة خط الأنابيب.
- تحسين أداء خطوط الأنابيب، وتخزين البيانات، ووقت المعالجة، وتكاليف البنية التحتية.
- تطوير أطر استيعاب البيانات وتحويلها القابلة لإعادة الاستخدام بدلاً من البرامج النصية لمرة واحدة.
- استكشاف أخطاء فشل خطوط الأنابيب واختناقات الأداء ومشكلات جودة البيانات لضمان حلها في الوقت المناسب.
- التعاون مع فرق ذكاء الأعمال والمنتج وعلوم البيانات والهندسة لتقديم مجموعات بيانات موثوقة وجاهزة للإنتاج.
- إنشاء والحفاظ على معايير هندسة البيانات، والوثائق الفنية، وأفضل ممارسات التطوير.
المتطلبات
- درجة البكالوريوس في علوم الكمبيوتر، هندسة البرمجيات، علوم البيانات، أو مجال ذي صلة.
- 4-6 سنوات من الخبرة المهنية في هندسة البيانات أو دور وثيق الصلة.
- خبرة عملية قوية في تصميم وتنفيذ خطوط أنابيب ETL/ELT على مستوى الإنتاج.
- إتقان قوي للغة Python لمعالجة البيانات، والأتمتة، وسير عمل هندسة البيانات.
- مهارات SQL المتقدمة وفهم قوي لقواعد البيانات العلائقية.
- خبرة عملية في الإنتاج مع Apache Airflow لتنسيق سير العمل.
- خبرة عملية مع Apache Spark ومعالجة البيانات الموزعة.
- فهم قوي لنمذجة البيانات، وأنماط التحول، وبنية خطوط البيانات.
- تجربة مع Redis واستراتيجيات التخزين المؤقت وأنماط الوصول إلى البيانات عالية الأداء.
- خبرة في معالجة مجموعات البيانات الكبيرة وتحسين أداء خطوط الأنابيب والاستعلام.
- فهم قوي لجودة البيانات، والتحقق من صحتها، ورصدها، وقابليتها للملاحظة، وموثوقية خط الأنابيب.
- الإلمام بنظام التشغيل Linux وGit وDocker/containers وممارسات هندسة البرمجيات الحديثة.
- مهارات تحليلية قوية، واستكشاف الأخطاء وإصلاحها، والتواصل، والتعاون متعدد الوظائف.
المؤهل المفضل
- تجربة مع منصات البيانات السحابية وخدمات تخزين الكائنات مثل AWS أو Azure أو GCP.
- خبرة في العمل مع PostgreSQL أو مستودعات البيانات أو قواعد البيانات التحليلية.
- خبرة في معالجة البيانات الجغرافية المكانية أو مجموعات البيانات المستندة إلى الموقع على نطاق واسع.
- الإلمام بـ DuckDB أو Apache Sedona أو Trino أو Presto أو التقنيات التحليلية المشابهة.
- خبرة في معالجة بيانات الأحداث كبيرة الحجم، أو التنقل، أو المعاملات، أو البيانات الجغرافية المكانية.
- الإلمام بخطوط أنابيب CI/CD وممارسات البنية التحتية والتعليمات البرمجية.
- خبرة في دعم منتجات البيانات أو منصات التحليلات أو خطوط أنابيب AI/ML.
المسؤوليات
1Design, develop, and maintain scalable ETL/ELT pipelines for data ingestion, transformation, validation, and delivery.
2Build, schedule, and orchestrate production-grade data workflows using Apache Airflow .
3Develop distributed data-processing jobs using Apache Spark .
4Write efficient, reusable, and maintainable Python code for data processing, automation, and pipeline development.
5Develop and optimize complex SQL queries for data transformation, analysis, and quality validation.
6Design pipelines capable of processing large-scale structured, semi-structured, and unstructured datasets.
7Implement Redis for caching, high-performance data access, and data-intensive application requirements.
8Integrate data from APIs, relational databases, files, third-party providers, and other internal and external sources.
المتطلبات
1Bachelor’s degree in Computer Science, Software Engineering, Data Science , or a related field.
24–6 years of professional experience in Data Engineering or a closely related role.
3Strong hands-on experience designing and implementing production-grade ETL/ELT pipelines .
4Strong proficiency in Python for data processing, automation, and data-engineering workflows.
5Advanced SQL skills and a strong understanding of relational databases.
6Practical production experience with Apache Airflow for workflow orchestration.
7Hands-on experience with Apache Spark and distributed data processing.
8Strong understanding of data modelling, transformation patterns, and data-pipeline architecture.
9Experience with Redis , caching strategies, and high-performance data-access patterns.
10Experience processing large datasets and optimizing pipeline and query performance.
11Strong understanding of data quality, validation, monitoring, observability, and pipeline reliability.
12Familiarity with Linux, Git, Docker/containers , and modern software-engineering practices.
13Strong analytical, troubleshooting, communication, and cross-functional collaboration skills.
14Experience with cloud data platforms and object storage services such as AWS, Azure, or GCP .
المهارات والوسوم
Cluster HeadSAPythonSQLPostgreSQLAWSAzureDockerData Analysis