Veuillez soumettre votre CV en anglais et indiquer votre niveau d’anglais. Mindrift met en relation des spécialistes avec des opportunités d’IA basées sur des projets pour de grandes entreprises technologiques, axées sur le test, l’évaluation et l’amélioration des systèmes d’IA. La participation est liée à des projets, et non à un emploi permanent.
**En quoi consiste cette opportunité**
Nous construisons un ensemble de données pour évaluer des agents de codage IA—dans quelle mesure un modèle gère des tâches du monde réel réalisées par des développeurs. Vous créerez des tâches exigeantes et des critères d’évaluation dans des environnements de simulation réalistes :
– **Construire des environnements de développeur réalistes** : une entreprise virtuelle comprenant une base de code, l’infrastructure et le contexte (tickets, documentation, conversations) reflétant une histoire de développement crédible
– **Créer des tâches à partir d’états intermédiaires** de ces environnements : élaborer le prompt, définir ce que signifie « résolu », et veiller à ce que la tâche puisse être accomplie par un agent IA
– **Rédiger des tests** pour confirmer les solutions des agents : accepter toutes les approches valides et rejeter les réponses incorrectes, sans être ni trop strict ni trop indulgent
– **Itérer sur les tâches et les tests** à partir des retours QA : examiner les sorties des agents, analyser les échecs et affiner l’évaluation jusqu’à ce qu’elle soit juste et fiable
**Ce que ce n’est PAS**
– Pas de **labelisation de données**
– Pas de **conception de prompts**
– Pas d’**écriture de code à partir de zéro** : l’agent produit la majeure partie du code ; vous l’encadrez et l’évaluez
**Ce que nous recherchons**
– **5 ans ou plus** d’expérience en développement logiciel
– Stack de base : **Python (FastAPI)**, **JavaScript/TypeScript (React)**, **Docker**, **Postgres**, **Kafka**, **Redis**
– Expérience dans l’écriture de tests (fonctionnels et d’intégration)
– Maîtrise de l’anglais (niveau **B2+**)
**Pourquoi c’est difficile**
Les modèles de pointe sont déjà très performants en matière de codage. En revanche, concevoir des tâches qui mettent vraiment à l’épreuve les meilleurs modèles est complexe. Vous devez comprendre en profondeur où les modèles échouent et quels scénarios distinguent une solution solide d’une solution faible. Comme les tâches peuvent comporter de nombreuses solutions correctes, écrire des tests qui acceptent toutes les réponses valides tout en rejetant les réponses incorrectes est plus difficile qu’il n’y paraît.
**Fonctionnement**
Candidater → Réaliser la/les qualification(s) → Rejoindre un projet → Terminer les tâches → Être rémunéré(e)
**Estimation de l’effort**
Les tâches de ce projet sont estimées à **20 heures** à réaliser, selon la complexité. Il s’agit d’une estimation plutôt que d’un planning fixe : vous décidez quand et comment travailler. Vous devez soumettre les tâches avant la date limite et respecter les critères d’acceptation pour être validé(e).
**Rémunération**
Jusqu’à l’équivalent de **50 $/heure**, selon votre niveau et votre rythme. Chaque tâche est estimée à environ **20 heures** ; vous établissez votre propre calendrier.
To apply for this job, please visit the application page

