Mindrift

HQ: Saudi Arabia

more jobs in this category:

  • -> Transcriptionist @ Literably
  • -> English Transcript Editor @ 3Play Media
  • -> Freelance Writer @ IAPWE
  • -> IvyMath Online Math Instructor/Tutor - $22/hour - Fully Remote @ IvyMath
  • -> Online English Teacher @ Magic Ears

Por favor, envie o seu CV em inglês e indique o seu nível de proficiência em inglês. Mindrift conecta especialistas a oportunidades de IA baseadas em projetos para empresas de tecnologia líderes, com foco em testar, avaliar e melhorar sistemas de IA. A participação é baseada em projetos, e não em emprego permanente.

Em que consiste esta oportunidade
Estamos construindo um dataset para avaliar agentes de IA que codificam — o quão bem um modelo lida com tarefas do mundo real executadas por desenvolvedores. Você criará tarefas desafiadoras e critérios de avaliação em ambientes simulados realistas:
– Construir ambientes realistas de desenvolvedor: uma empresa virtual incluindo um repositório de código, infraestrutura e contexto (tickets, documentação, conversas) que reflita uma história de desenvolvimento crível
– Criar tarefas a partir de estados intermediários desses ambientes: formular o prompt, definir o que significa “resolvido” e garantir que a tarefa possa ser concluída por um agente de IA
– Escrever testes para confirmar as soluções dos agentes: aceitar todas as abordagens válidas e rejeitar as incorretas, sem ser excessivamente rígido nem excessivamente permissivo
– Iterar em tarefas e testes com base no feedback de QA: revisar as saídas dos agentes, analisar falhas e refinar a avaliação até que ela seja justa e confiável

O que isto NÃO é
– Não é rotulagem de dados
– Não é engenharia de prompts
– Não é escrever código do zero: o agente escreve a maior parte do código; você orienta e avalia

O que buscamos
– 5+ anos de experiência em desenvolvimento de software
– Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis
– Experiência escrevendo testes (funcionais e de integração)
– Proficiency em inglês (B2+)

Por que isto é difícil
Modelos de ponta já são muito fortes em programação. No entanto, criar tarefas que realmente desafiem os melhores modelos é difícil. Você precisa compreender profundamente onde os modelos falham e quais cenários diferenciam uma solução forte de uma fraca. Como as tarefas podem ter muitas soluções corretas, escrever testes que aceitem todas as respostas válidas e rejeitem as incorretas é mais difícil do que parece.

Como funciona
Candidatar-se → Concluir qualificação(ões) → Entrar em um projeto → Finalizar tarefas → Ser remunerado

Estimativa de esforço
As tarefas deste projeto são estimadas para levar 20 horas para serem concluídas, dependendo da complexidade. Esta é uma estimativa, não um cronograma fixo: você decide quando e como trabalhar. Você deve enviar as tarefas até o prazo e atender aos critérios de aceitação para ser aprovado.

Remuneração
Até o equivalente a US$ 50/hora, dependendo do seu nível e ritmo. Cada tarefa é estimada em cerca de 20 horas; você define seu próprio cronograma.

Apply info ->

To apply for this job, please visit the application page

Shopping Cart
There are no products in the cart!
Total
 0.00
0