中文

基于奖励建模从人类偏好中学习机器翻译评估

计算与语言 2025-04-21 v1

摘要

机器翻译评估的关键挑战在于人类评分的内在噪声和不一致性。基于回归的神经网络指标难以处理这种噪声,而利用提示LLM在系统层面评估方面显示出前景,但在段落层面表现不佳。本文提出了ReMedy,一种新的机器翻译指标框架,将翻译评估重新表述为奖励建模任务。ReMedy不直接对不完美的人类评分进行回归,而是利用成对偏好数据学习翻译质量的相对排序,从而实现更可靠的评估。在广泛的实验中,我们在WMT22-24共享任务中进行了评估(39种语言对,111个MT系统)。ReMedy实现了在段落和系统层面的最先进性能。具体而言,ReMedy-9B超越了更大的WMT获奖者以及大型封闭LLM,如MetricX-13B、XCOMET-Ensemble、GEMBA-GPT-4、PaLM-540B和微调后的PaLM2。进一步的分析表明,ReMedy在检测翻译错误和评估低质量翻译方面具有卓越的能力。

关键词

引用

@article{arxiv.2504.13630,
  title  = {Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling},
  author = {Shaomu Tan and Christof Monz},
  journal= {arXiv preprint arXiv:2504.13630},
  year   = {2025}
}