中文

MENLO:从偏好到熟练度 —— 跨 47 种语言评估本土化质量

计算与语言 2026-03-03 v3 人工智能 机器学习

摘要

确保大语言模型(LLM)响应在多语言环境下的本土化质量具有挑战性。为此,我们引入 MENLO 框架,基于受众设计机制操作化对本土化响应质量的评估。通过 MENLO,我们构建了一个包含 6,423 组人工标注的提示-响应偏好数据集,覆盖四个质量维度,在 47 种语言变体中实现高的注释者间一致性。我们的评估结果表明,零样本 LLM 评判器在两两评估与结构化标注评级指南方面受益显著,但仍不及人类标注者。我们通过强化学习微调、奖励塑形和多任务学习方法,实现了显著的性能提升。此外,我们展示了通过 RL 训练的评判器可作为生成式奖励模型,用于提升 LLM 的多语言熟练度,尽管与人类判断仍存在差异。我们的研究表明,面向可扩展多语言评估与偏好对齐的前景充满希望。我们公开了数据集和评估框架以支持进一步的研究(https://huggingface.co/datasets/facebook/menlo)。

关键词

引用

@article{arxiv.2509.26601,
  title  = {MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages},
  author = {Chenxi Whitehouse and Sebastian Ruder and Tony Lin and Oksana Kurylo and Haruka Takagi and Janice Lam and Nicolò Busetto and Denise Diaz and Francisco Guzmán},
  journal= {arXiv preprint arXiv:2509.26601},
  year   = {2026}
}

备注

ICLR 2026