KI-Code-Agenten-Evaluationsingenieur

last updated July 27, 2026 5:19 UTC

Mindrift

HQ: Saudi Arabia

more jobs in this category:

  • -> Transcriptionist @ Literably
  • -> English Transcript Editor @ 3Play Media
  • -> Freelance Writer @ IAPWE
  • -> IvyMath Online Math Instructor/Tutor - $22/hour - Fully Remote @ IvyMath
  • -> Online English Teacher @ Magic Ears

Bitte reichen Sie Ihren Lebenslauf auf Englisch ein und geben Sie Ihr Sprachniveau in Englisch an. Mindrift verbindet Fachkräfte mit projektbasierten KI-Möglichkeiten für führende Tech-Unternehmen – mit dem Fokus auf das Testen, Bewerten und Verbessern von KI-Systemen. Die Teilnahme erfolgt projektbasiert und nicht als unbefristete Anstellung.

**Worum es bei dieser Gelegenheit geht**
Wir erstellen einen Datensatz zur Bewertung von KI-Coding-Agents – also wie gut ein Modell reale Aufgaben bewältigt, wie sie von Entwicklerinnen und Entwicklern durchgeführt werden. Sie erstellen anspruchsvolle Aufgaben und Bewertungskriterien in realistischen simulierten Umgebungen:
– **Realisitische Entwicklerumgebungen aufbauen:** ein virtuelles Unternehmen mit Codebase, Infrastruktur und Kontext (Tickets, Dokumentation, Gespräche), das eine glaubwürdige Entwicklungshistorie abbildet
– **Aufgaben aus Zwischenständen dieser Umgebungen erstellen:** den Prompt formulieren, definieren, was als „gelöst“ gilt, und sicherstellen, dass die Aufgabe von einem KI-Agenten erledigt werden kann
– **Tests schreiben, um Agentenlösungen zu bestätigen:** alle gültigen Ansätze akzeptieren und falsche ablehnen – ohne zu streng oder zu nachsichtig zu sein
– **Aufgaben und Tests iterativ anhand von QA-Feedback verbessern:** Agenten-Ausgaben prüfen, Fehler analysieren und die Bewertung verfeinern, bis sie fair und zuverlässig ist

**Was das nicht ist**
– **Keine reine Datenerfassung (Data Labeling)**
– **Kein Prompt Engineering**
– **Kein vollständiges Programmieren von Grund auf:** Der Agent schreibt den Großteil des Codes; Sie steuern und bewerten

**Wonach wir suchen**
– **5+ Jahre Erfahrung in der Softwareentwicklung**
– **Core Stack:** Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis
– **Erfahrung im Schreiben von Tests** (funktional und Integration)
– **Englischkenntnisse (B2+)**

**Warum das herausfordernd ist**
Frontier-Modelle sind beim Programmieren bereits sehr stark. Allerdings ist es schwierig, Aufgaben zu entwickeln, die wirklich die besten Modelle herausfordern. Dafür braucht es ein tiefes Verständnis dafür, wo Modelle typischerweise scheitern und welche Szenarien eine starke Lösung von einer schwachen unterscheiden. Da Aufgaben oft viele korrekte Lösungen haben, ist es anspruchsvoller, Tests zu schreiben, die alle gültigen Antworten akzeptieren und dennoch falsche zuverlässig ablehnen, als es zunächst scheint.

**So funktioniert es**
Bewerbung → Teilnahme an(en) Qualifikationsaufgabe(n) → Projekt beitreten → Aufgaben abschließen → bezahlt werden

**Einschätzung des Aufwands**
Die Aufgaben für dieses Projekt werden auf **20 Stunden** geschätzt, abhängig von der Komplexität. Das ist eine Orientierung und kein fester Zeitplan: Sie entscheiden, wann und wie Sie arbeiten. Sie müssen Aufgaben bis zur Deadline einreichen und die Akzeptanzkriterien erfüllen, um genehmigt zu werden.

**Vergütung**
Bis zu einem Gegenwert von **50 US-Dollar pro Stunde**, abhängig von Ihrem Level und Ihrem Tempo. Jede Aufgabe wird auf etwa 20 Stunden geschätzt; Sie legen Ihren Zeitplan selbst fest.

Apply info ->

To apply for this job, please visit the application page

Shopping Cart
There are no products in the cart!
Total
 0.00
0