请用英文提交你的简历,并注明你的英语水平。Mindrift 将专业人士与基于项目的 AI 机会连接起来,服务于领先的科技公司,重点在于测试、评估和改进 AI 系统。参与方式为项目制,而非永久性雇佣。
该机会包含哪些内容
我们正在构建一个用于评估 AI 编码代理(coding agents)的数据集——衡量模型在开发者执行的真实任务中表现如何。你将使用逼真的模拟环境创建具有挑战性的任务及评估标准:
– 构建真实的开发者环境:一个虚拟公司,包括代码库、基础设施以及上下文(工单、文档、对话),以还原可信的开发历史
– 从这些环境的中间状态出发设计任务:编写提示词、定义“解决”的标准,并确保该任务可被 AI 代理完成
– 编写测试以确认代理的解法:接受所有有效的方案,并拒绝不正确的方案,既不过于苛刻也不过于宽松
– 根据 QA 反馈迭代任务与测试:审阅代理输出、分析失败原因,并持续优化评估,直到其公平且可靠
这不包含什么
– 不属于数据标注
– 不属于提示词工程
– 不需要从零编写代码:主要由代理编写代码,你负责指导与评估
我们在寻找什么
– 5 年以上的软件开发经验
– 核心技术栈:Python(FastAPI)、JavaScript/TypeScript(React)、Docker、Postgres、Kafka、Redis
– 具备编写测试的经验(功能测试与集成测试)
– 英语能力(B2+)
为什么这很难
前沿模型在编码方面已经很强。然而,创建真正能挑战最强模型的任务并不容易。你需要深入理解模型在哪些方面会失败,以及哪些场景能区分强解法与弱解法。由于任务可能存在许多正确解法,编写既能接受所有有效答案、又能拒绝错误答案的测试,比表面看起来更难。
工作流程
申请 → 完成资格/测评 → 加入项目 → 完成任务 → 获得报酬
预计投入
本项目的任务预计总计需要 20 小时,具体取决于复杂度。这是预估而非固定排期:你可以自行决定何时以及如何工作。你必须在截止日期前提交任务,并满足验收标准,才能通过审核。
报酬
根据你的水平与工作节奏,时薪等值最高可达 50 美元。每个任务预计约 20 小时;你的排期由你自行安排。
To apply for this job, please visit the application page

