Tabbio
تسجيل الدخول إلى التطبيق
أول أمس

مهندس بيانات

Coretek Services · Kondapur, Telangana, India
Workableقدّم عبر موقع الشركة
Full Time
Hybrid

نبذة عن الوظيفة

تبحث Coretek عن مهندس بيانات لبناء وتشغيل خطوط الأنابيب ونماذج البيانات التي تعمل عليها بقية الأعمال. ستمتلك الاستيعاب بدءًا من الأنظمة المصدر وحتى مجموعات البيانات المنسقة والموثقة جيدًا والتي يعتمد عليها المحللون وعلماء البيانات وفرق التطبيق. هذا دور هندسي عملي: ستكتب رمز الإنتاج ومخططات التصميم وستكون مسؤولاً عن موثوقية وتكلفة ما تشحنه.

المسؤوليات

  • تصميم وبناء وصيانة خطوط أنابيب البيانات المجمعة والمتدفقة التي تكون غير فعالة ويمكن ملاحظتها واستردادها.
  • البيانات النموذجية للتحليلات (نماذج الأبعاد، والطبقات الدلالية، والأسواق المنسقة)، وموازنة أداء الاستعلام مقابل إمكانية الصيانة.
  • دمج البيانات من قواعد البيانات التشغيلية وواجهات برمجة تطبيقات SaaS والملفات وتدفقات الأحداث، بما في ذلك التعامل مع انحراف المخطط والبيانات المتأخرة الوصول.
  • إنشاء فحوصات جودة البيانات (الحداثة، الحجم، التفرد، التكامل المرجعي) في خطوط الأنابيب بدلاً من تثبيتها بعد ذلك، وتحديد كيفية تنبيه حالات الفشل وتصاعدها.
  • خطوط الأنابيب الخاصة في الإنتاج: المراقبة، والتناوب عند الطلب لحوادث البيانات، وتحليل السبب الجذري، وعمليات الردم.
  • ضبط الأداء والتكلفة (التقسيم والتجميع وحجم الملفات والمستودعات وحجم المجموعة) وجعل المفاضلات واضحة.
  • تطبيق الانضباط الهندسي على البيانات: التحكم في الإصدار، ومراجعة التعليمات البرمجية، وCI/CD، والاختبار الآلي، والبنية التحتية كرمز.
  • تنفيذ ضوابط الوصول، ومعالجة معلومات تحديد الهوية الشخصية (PII)، والاحتفاظ بها، ومتطلبات النسب والتدقيق بالشراكة مع الأمان والامتثال.
  • الشراكة مع المحللين وعلماء البيانات ومهندسي المنتجات لتحويل المتطلبات الغامضة إلى عقود بيانات دائمة.
  • الاحتفاظ بقواميس البيانات، والنسب، ودفاتر تشغيل خطوط الأنابيب حتى يتمكن المستهلكون من العثور على مجموعة بيانات، وفهم معنى كل حقل ومدى حداثته، واستخدامها بشكل صحيح دون الحاجة إلى سؤال الفريق الذي قام بإنشائها.

المتطلبات

  • 5+ سنوات بناء خطوط أنابيب بيانات الإنتاج.
  • تطوير عملي قوي للغة Python لهندسة البيانات، مع ممارسة الاختبار الحقيقي والتعبئة ومراجعة التعليمات البرمجية، وليس البرمجة النصية وحدها.
  • معرفة عملية بـ PySpark: DataFrame وSQL APIs، وعمليات الانضمام والتجميع على نطاق واسع، وسلوك التقسيم والتبديل، والقدرة على قراءة Spark UI لتشخيص المهمة البطيئة أو الفاشلة.
  • SQL قوي: وظائف النافذة، وخطط الاستعلام، وضبط الأداء، وليس التحديدات فقط.
  • التدريب العملي على الخبرة مع النظام الأساسي للبيانات Azure: Data Factory، وDatabricks، وSynapse/Fabric، وADLS.
  • أساسيات نمذجة البيانات الصلبة: التطبيع، ومخططات النجوم، والأبعاد المتغيرة ببطء.
  • سير العمل القائم على Git وتجربة الشحن من خلال CI/CD.
  • مهارات اتصال ممتازة، مع القدرة على تصحيح خط الأنابيب الفاشل من البداية إلى النهاية وتوضيح التأثير على جماهير متنوعة، بما في ذلك أصحاب المصلحة غير التقنيين.
  • مهارات تحليلية وحل المشكلات استثنائية، مع الحكم على العثور على السبب الجذري لمشكلة البيانات بدلاً من تصحيح الأعراض.
  • معرفة وخبرة قوية في العمل مع العملاء من خلال نهج استشاري في بيئة تقنية.

مؤهلات إضافية

  • تجربة البث (كافكا، مراكز الأحداث).
  • أشكال البحيرة: بحيرة الدلتا، جبل الجليد.
  • البنية التحتية كرمز (Terraform، Bicep) والحاويات (Docker، Kubernetes).
  • خبرة في بيئة منظمة (HIPAA، SOC 2، PCI، الناتج المحلي الإجمالي): إمكانية التدقيق، والتشفير، وإقامة البيانات.
  • تجربة بناء منصات البيانات لتعلم الآلة أو دعم خطوط أنابيب الميزات.
  • ثبت القدرة على إدارة مشاريع العملاء المتعددة وتقديم نتائج عالية الجودة في الوقت المحدد.
  • خبرة في Azure DevOps أو GitHub للتحكم بالمصادر وخطوط الأنابيب.

المسؤوليات

1Design, build, and maintain batch and streaming data pipelines that are idempotent, observable, and recoverable.
2Model data for analytics (dimensional models, semantic layers, and curated marts), balancing query performance against maintainability.
3Integrate data from operational databases, SaaS APIs, files, and event streams, including handling schema drift and late-arriving data.
4Build data quality checks (freshness, volume, uniqueness, referential integrity) into pipelines rather than bolting them on afterward, and define how failures alert and escalate.
5Own pipelines in production: monitoring, on-call rotation for data incidents, root-cause analysis, and backfills.
6Tune performance and cost (partitioning, clustering, file sizing, warehouse and cluster sizing) and make the tradeoffs explicit.
7Apply engineering discipline to data: version control, code review, CI/CD, automated testing, and infrastructure as code.
8Implement access controls, PII handling, retention, and lineage and audit requirements in partnership with security and compliance.

المتطلبات

15+ years building production data pipelines.
2Strong hands-on Python development for data engineering, with real testing, packaging, and code review practice, not scripting alone.
3Working knowledge of PySpark: DataFrame and SQL APIs, joins and aggregations at scale, partitioning and shuffle behavior, and the ability to read a Spark UI to diagnose a slow or failing job.
4Strong SQL: window functions, query plans, and performance tuning, not just SELECTs.
5Hands-on experience with the Azure data platform: Data Factory, Databricks, Synapse/Fabric, and ADLS.
6Solid data modeling fundamentals: normalization, star schemas, slowly changing dimensions.
7Git-based workflow and experience shipping through CI/CD.
8Excellent communication skills, with the ability to debug a failing pipeline end to end and articulate the impact to diverse audiences, including non-technical stakeholders.
9Exceptional analytical and problem-solving skills, with the judgment to find the root cause of a data issue rather than patching the symptom.
10Strong knowledge and experience in working with customers in a consultative approach in a technical environment.
11Streaming experience (Kafka, Event Hubs).
12Lakehouse formats: Delta Lake, Iceberg.
13Infrastructure as code (Terraform, Bicep) and containerization (Docker, Kubernetes).
14Experience in a regulated environment (HIPAA, SOC 2, PCI, GDPR): auditability, encryption, data residency.

المهارات والوسوم

INPythonSQLAzureDockerKubernetesDevOpsAuditData AnalysisLogisticsWarehouseCompliance

احجز رابط tabbio
قبل أن يُحجز