多语言大语言模型评估:语气与流畅性

last updated July 18, 2026 6:31 UTC

CrowdGen by Appen

HQ: Remote

more jobs in this category:

  • -> Transcriptionist @ Literably
  • -> English Transcript Editor @ 3Play Media
  • -> Freelance Writer @ IAPWE
  • -> IvyMath Online Math Instructor/Tutor - $22/hour - Fully Remote @ IvyMath
  • -> Online English Teacher @ Magic Ears

加入“Spearmint 项目”,这是一个多语言的 AI 回复评估计划,旨在对不同语言中的大语言模型(LLM)输出进行评审,重点评估内容的“语气”或“流畅度”。你必须具备目标语言的母语级流利度,并且对英语有很强的理解能力。

作为评估者,你将审阅简短且已预先分段的数据集,并依据特定的质量标准对模型生成的回复进行判断。你的工作将有助于验证评估框架,并为未来模型改进建立基线质量基准。

主要职责:
– 用你的母语评估模型回复,重点关注“语气”或“流畅度”。
– 评估每条回复的整体质量、准确性与自然程度。
– 阅读用户提示以及两条模型回复,然后使用五分制对每条回复进行评分。
– 对任何极端评分提供简要说明。

项目概览:
– 第 1 批次——语气:检查回复是否有帮助、是否有洞见、是否引人入胜且是否公平。识别诸如措辞不匹配、居高临下、偏见或其他语气问题。
– 第 2 批次——流畅度:审查语法正确性、表达清晰度、连贯性以及自然的行文流动感。

这是通过 CrowdGen 进行的项目制机会;你将以独立承包商身份加入 CrowdGen 社区。若你被选中,CrowdGen 会通过你的申请邮箱发送邮件,告知你创建账户的步骤。你需要登录、重置密码、完成设置要求,并继续完成该岗位的申请流程。

助力塑造 AI 的未来——立即申请,并可在家贡献力量。

$3.70–$3.70/小时

Apply info ->

To apply for this job, please visit the application page

Shopping Cart
There are no products in the cart!
Total
 0.00
0