Tabbio
تسجيل الدخول إلى التطبيق
أول أمس

مهندس تقييم الذكاء الاصطناعي (Python، QA أو Security)

Mindrift · Egypt
Workableقدّم عبر موقع الشركة
Part Time
Remote

نبذة عن الوظيفة

يرجى تقديم سيرتك الذاتية باللغة الإنجليزية والإشارة إلى مستوى إجادتك للغة الإنجليزية. تعمل Mindrift على ربط المتخصصين بفرص الذكاء الاصطناعي القائمة على المشاريع لشركات التكنولوجيا الرائدة، مع التركيز على اختبار أنظمة الذكاء الاصطناعي وتقييمها وتحسينها. المشاركة قائمة على المشاريع وليست توظيفاً دائماً. ما تتضمنه هذه الفرصة نحن نبني مجموعة بيانات لتقييم وكلاء ترميز الذكاء الاصطناعي - مدى جودة تعامل النموذج مع مهام المطورين في العالم الحقيقي.

ستقوم بإنشاء مهام صعبة ومعايير تقييم ضمن بيئات محاكاة واقعية:

  • إنشاء بيئات واقعية للمطورين - شركة افتراضية تتمتع بقاعدة تعليمات برمجية وبنية أساسية وسياق (التذاكر والمستندات والمحادثات) تشكل تاريخًا معقولاً للتنمية
  • تصميم المهام من الحالات المتوسطة لهذه البيئات - صياغة المطالبة وتحديد معنى "تم الحل" والتأكد من أن المهمة قابلة للحل بواسطة وكيل الذكاء الاصطناعي
  • اكتب اختبارات تتحقق من الحلول الفعالة - اقبل جميع الأساليب الصحيحة وارفض الأساليب غير الصحيحة، سواء كانت صارمة للغاية أو متساهلة للغاية
  • تكرار المهام والاختبارات بناءً على تعليقات ضمان الجودة - مراجعة حلول الوكيل وتحليل حالات الفشل والتحسين حتى يصبح التقييم عادلاً وقويًا

ما هذا ليس

  • عدم وضع العلامات على البيانات
  • لا الهندسة السريعة
  • عدم كتابة التعليمات البرمجية من الصفر - يقوم الوكيل بكتابة معظم التعليمات البرمجية. أنت تقوم بالتوجيه والتقييم

ما نبحث عنه

  • 5+ سنوات في تطوير البرمجيات
  • المكدس الأساسي: Python (FastAPI)، JavaScript/TypeScript (React)، Docker، Postgres، Kafka، Redis
  • تجربة كتابة الاختبارات (الوظيفية والتكامل)
  • إجادة اللغة الإنجليزية - B2+

لماذا هذا صعب النماذج الحدودية جيدة بالفعل في البرمجة. إن إنشاء مهمة تتحدى أفضل النماذج حقًا ليس بالأمر الهين. أنت بحاجة إلى أن تفهم بعمق أين تفشل النماذج وما هي السيناريوهات التي تكشف الفرق بين الحل الجيد والحل السيئ. تحتوي المهام على العديد من الحلول الصحيحة - فكتابة الاختبارات التي تقبل جميع الحلول الصحيحة وترفض الحلول غير الصحيحة أصعب مما يبدو.

كيف يعمل التقديم ← اجتياز المؤهلات ← الانضمام إلى مشروع ← إكمال المهام ← الحصول على الأموال

التعويض ما يصل إلى ما يعادل 40 دولارًا في الساعة، اعتمادًا على المستوى والوتيرة. تقدر المهام بـ 20 ساعة تقريبًا لكل منها؛ قمت بتعيين الجدول الزمني الخاص بك.

المسؤوليات

1Build realistic developer environments - a virtual company with codebase, infrastructure, and context (tickets, docs, conversations) that forms a believable development history
2Design tasks from intermediate states of these environments - craft the prompt, define what "solved" means, and ensure the task is solvable by an AI agent
3Write tests that verify agent solutions - accept all valid approaches and reject incorrect ones, neither too strict nor too lenient
4Iterate on tasks and tests based on QA feedback - review agent solutions, analyze failures, and refine until the evaluation is fair and robust
5Not data labeling
6Not prompt engineering
7Not writing code from scratch - the agent writes most of the code; you guide and evaluate
85+ years in software development

المهارات والوسوم

Software TesterEGReactTypeScriptJavaScriptPythonPostgreSQLDocker

احجز رابط tabbio
قبل أن يُحجز