中文

大规模推理模型是否是优秀的翻译评估器?分析与性能提升

计算与语言 2025-10-24 v1 人工智能

摘要

最近的大规模推理模型(LRM)引入了在生成最终答案之前的中间“思考”过程,提高了其在复杂下游任务上的推理能力。然而,LRM 作为机器翻译(MT)质量评估器的潜力尚未得到充分探索。我们首次系统性地分析了 LRM 作为评判员在 MT 评估中的应用。我们识别出关键挑战,揭示 LRM 需要针对性的评估材料,倾向于“过度思考”更简单的实例,并且在评分机制上存在问题导致高估。为此,我们提出通过在合成的人类化思考轨迹上训练来校准 LRM 的思考过程。我们在 WMT24 Metrics 基准测试上的实验表明,这一方法将思考预算大约降低 ~35 倍,同时在 7B 至 32B 不同 LRM规模上提升评估性能(例如,R1-Distill-Qwen-7B 实现了 +8.7 的相关性提升)。这些发现凸显了经过高效校准的 LRM 在推进细粒度自动 MT 评估方面的潜力。

关键词

引用

@article{arxiv.2510.20780,
  title  = {Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost},
  author = {Runzhe Zhan and Zhihong Huang and Xinyi Yang and Lidia S. Chao and Min Yang and Derek F. Wong},
  journal= {arXiv preprint arXiv:2510.20780},
  year   = {2025}
}

备注

NeurIPS 2025