Mindrift

HQ: Saudi Arabia

more jobs in this category:

  • -> Transcriptionist @ Literably
  • -> English Transcript Editor @ 3Play Media
  • -> Freelance Writer @ IAPWE
  • -> IvyMath Online Math Instructor/Tutor - $22/hour - Fully Remote @ IvyMath
  • -> Online English Teacher @ Magic Ears

Por favor, envía tu CV en inglés e indica tu nivel de dominio del inglés. Mindrift conecta especialistas con oportunidades de IA basadas en proyectos para empresas tecnológicas líderes, centradas en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto y no supone un empleo permanente.

En qué consiste esta oportunidad
Estamos creando un conjunto de datos para evaluar agentes de codificación con IA: qué tan bien gestiona un modelo tareas del mundo real realizadas por desarrolladores. Crearás tareas desafiantes y criterios de evaluación en entornos de simulación realistas:
– Construir entornos de desarrollo realistas: una empresa virtual que incluya un repositorio de código, infraestructura y contexto (tickets, documentación, conversaciones) que refleje una trayectoria de desarrollo creíble
– Crear tareas a partir de estados intermedios de estos entornos: redactar el prompt, definir qué significa “resuelto” y garantizar que la tarea pueda ser completada por un agente de IA
– Escribir pruebas para confirmar las soluciones del agente: aceptar todas las soluciones válidas y rechazar las incorrectas, sin ser demasiado estrictos ni demasiado permisivos
– Iterar sobre tareas y pruebas con base en la retroalimentación de QA: revisar las salidas de los agentes, analizar fallos y refinar la evaluación hasta que sea justa y fiable

Qué NO es
– No es etiquetado de datos
– No es ingeniería de prompts
– No es escribir código desde cero: el agente escribe la mayor parte del código; tú guías y evalúas

Qué buscamos
– 5+ años de experiencia en desarrollo de software
– Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis
– Experiencia escribiendo pruebas (funcionales e integración)
– Dominio de inglés (B2+)

Por qué es difícil
Los modelos de frontera ya son muy fuertes en programación. Sin embargo, crear tareas que realmente desafíen a los mejores modelos es difícil. Necesitas una comprensión profunda de dónde fallan los modelos y qué escenarios distinguen una solución sólida de una débil. Como las tareas pueden tener muchas soluciones correctas, escribir pruebas que acepten todas las respuestas válidas y rechacen las incorrectas es más complicado de lo que parece.

Cómo funciona
Solicitar → Completar(n) la(s) calificación(es) → Unirte a un proyecto → Finalizar tareas → Recibir pago

Estimación de esfuerzo
Se estima que las tareas de este proyecto requieren 20 horas para completarse, según la complejidad. Esto es una estimación y no un calendario fijo: tú decides cuándo y cómo trabajar. Debes entregar las tareas antes del plazo y cumplir los criterios de aceptación para que sean aprobadas.

Compensación
Hasta un equivalente de 50 USD por hora, según tu nivel y tu ritmo. Cada tarea está estimada en unas 20 horas; tú estableces tu propio horario.

Apply info ->

To apply for this job, please visit the application page

Shopping Cart
There are no products in the cart!
Total
 0.00
0