Tabbio
تسجيل الدخول إلى التطبيق
قبل 3 أيام

مهندس بيانات أول

Autofleet · Bengaluru, Karnataka, India
Workableقدّم عبر موقع الشركة
Full Time
Hybrid
Senior

نبذة عن الوظيفة

نحن نجعل مستقبل التنقل ينبض بالحياة بدءًا من اليوم. في Autofleet، ندعم أكبر مشغلي أساطيل المركبات ومقدمي خدمات النقل في العالم لتحسين العمليات الحالية وإطلاق نماذج أعمال ديناميكية جديدة بسلاسة - قيادة العمليات الفعالة وتحقيق أقصى استفادة. تقع البنية التحتية للبيانات في قلب نظامنا الأساسي، مما يؤدي إلى قيادة نماذج التعلم الآلي المتقدمة وخوارزميات التحسين. باعتبارك مالك خطوط أنابيب البيانات، ستواجه تحديات متنوعة تشمل التحسين والتنبؤ والنمذجة والاستدلال والنقل ورسم الخرائط. بصفتك مهندس بيانات أول، ستلعب دورًا رئيسيًا في امتلاك وتوسيع نطاق البنية التحتية للبيانات الخلفية التي تدعم نظامنا الأساسي - مما يدعم التحسين في الوقت الفعلي والتحليلات المتقدمة وتطبيقات التعلم الآلي.

المتطلبات

  • تصميم وتنفيذ وصيانة خطوط بيانات قوية وقابلة للتطوير للمعالجة المجمعة وفي الوقت الفعلي باستخدام Spark والأدوات الحديثة الأخرى.
  • امتلاك البنية التحتية للبيانات الخلفية، بما في ذلك استيعاب مجموعات البيانات واسعة النطاق وتحويلها والتحقق من صحتها وتنسيقها.
  • الاستفادة من خدمات Google Cloud Platform (GCP) لتصميم وتشغيل حلول بيانات قابلة للتطوير وآمنة وفعالة من حيث التكلفة عبر دورة حياة المسار.
  • تطوير وتحسين سير عمل ETL/ELT عبر بيئات متعددة لدعم التطبيقات الداخلية والتحليلات وسير عمل التعلم الآلي.
  • بناء وصيانة أسواق البيانات ونماذج البيانات مع التركيز على الأداء وجودة البيانات وقابلية الصيانة على المدى الطويل.
  • التعاون مع فرق متعددة الوظائف بما في ذلك فرق التطوير ومديري المنتجات وأصحاب المصلحة الخارجيين لفهم متطلبات البيانات وترجمتها إلى حلول قابلة للتطوير.
  • المساعدة في اتخاذ القرارات الهيكلية المتعلقة بمعالجة البيانات الموزعة وموثوقية خطوط الأنابيب وقابلية التوسع.

الفوائد

  • 4+ سنوات في هندسة البيانات الخلفية أو تطوير البرامج التي تركز على البنية التحتية.
  • يتقن لغة بايثون، مع خبرة في بناء خدمات البيانات على مستوى الإنتاج.
  • فهم قوي لـ SQL
  • سجل حافل في تصميم وتشغيل خطوط أنابيب بيانات قابلة للتطوير ومنخفضة الكمون (الدُفعة والتدفق).
  • تجربة بناء وصيانة منصات البيانات، بما في ذلك البحيرات وخطوط الأنابيب وأدوات المطور.
  • على دراية بأدوات التنسيق مثل تدفق الهواء، وممارسات CI/CD الحديثة.
  • العمل المريح في البيئات السحابية الأصلية (AWS، وGCP)، بما في ذلك النقل بالحاويات (على سبيل المثال، Docker، وKubernetes).
  • المكافأة: خبرة في العمل مع Google Cloud Platform
  • المكافأة: خبرة في مراقبة جودة البيانات والتنبيه
  • المكافأة: تجربة مع Snowflake، DBT، Flink، Kafka
  • المكافأة: خبرة عملية قوية مع Spark لمعالجة البيانات الموزعة على نطاق واسع.
  • درجة علمية في علوم الكمبيوتر أو الهندسة أو المجال ذي الصلة.

المسؤوليات

1We are making the future of Mobility come to life starting today.
2Requirements
3Design, implement, and maintain robust, scalable data pipelines for batch and real-time processing using Spark, and other modern tools.
4Own the backend data infrastructure, including ingestion, transformation, validation, and orchestration of large-scale datasets.
5Leverage Google Cloud Platform (GCP) services to architect and operate scalable, secure, and cost-effective data solutions across the pipeline lifecycle.
6Develop and optimize ETL/ELT workflows across multiple environments to support internal applications, analytics, and machine learning workflows.
7Build and maintain data marts and data models with a focus on performance, data quality, and long-term maintainability.
8Help drive architectural decisions around distributed data processing, pipeline reliability, and scalability.

المتطلبات

1Design, implement, and maintain robust, scalable data pipelines for batch and real-time processing using Spark, and other modern tools.
2Own the backend data infrastructure, including ingestion, transformation, validation, and orchestration of large-scale datasets.
3Leverage Google Cloud Platform (GCP) services to architect and operate scalable, secure, and cost-effective data solutions across the pipeline lifecycle.
4Develop and optimize ETL/ELT workflows across multiple environments to support internal applications, analytics, and machine learning workflows.
5Build and maintain data marts and data models with a focus on performance, data quality, and long-term maintainability.
6Collaborate with cross-functional teams including development teams, product managers, and external stakeholders to understand and translate data requirements into scalable solutions.
7Help drive architectural decisions around distributed data processing, pipeline reliability, and scalability.

المزايا

14+ years in backend data engineering or infrastructure-focused software development.
2Proficient in Python, with experience building production-grade data services.
3Solid understanding of SQL
4Proven track record designing and operating scalable, low-latency data pipelines (batch and streaming).
5Experience building and maintaining data platforms, including lakes, pipelines, and developer tooling.
6Familiar with orchestration tools like Airflow, and modern CI/CD practices.

المهارات والوسوم

R&DINMachine LearningProduct ManagementData Analysis

احجز رابط tabbio
قبل أن يُحجز