大规模推理模型是否是优秀的翻译评估器?分析与性能提升
计算与语言
2025-10-24 v1 人工智能
摘要
最近的大规模推理模型(LRM)引入了在生成最终答案之前的中间“思考”过程,提高了其在复杂下游任务上的推理能力。然而,LRM 作为机器翻译(MT)质量评估器的潜力尚未得到充分探索。我们首次系统性地分析了 LRM 作为评判员在 MT 评估中的应用。我们识别出关键挑战,揭示 LRM 需要针对性的评估材料,倾向于“过度思考”更简单的实例,并且在评分机制上存在问题导致高估。为此,我们提出通过在合成的人类化思考轨迹上训练来校准 LRM 的思考过程。我们在 WMT24 Metrics 基准测试上的实验表明,这一方法将思考预算大约降低 ~35 倍,同时在 7B 至 32B 不同 LRM规模上提升评估性能(例如,R1-Distill-Qwen-7B 实现了 +8.7 的相关性提升)。这些发现凸显了经过高效校准的 LRM 在推进细粒度自动 MT 评估方面的潜力。
引用
@article{arxiv.2510.20780,
title = {Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost},
author = {Runzhe Zhan and Zhihong Huang and Xinyi Yang and Lidia S. Chao and Min Yang and Derek F. Wong},
journal= {arXiv preprint arXiv:2510.20780},
year = {2025}
}
备注
NeurIPS 2025