中文

PEAR:机器翻译中基于成对的自动相对评分

计算与语言 2026-05-28 v2

摘要

我们提出 PEAR(Pairwise Evaluation for Automatic Relative Scoring,即机器翻译中基于成对的自动相对评分),一种监督式质量评估(QE)指标族,将无参考机器翻译(MT)评估重新表述为带评分的成对比较。给定源段和两个候选译文,PEAR 预测它们质量差异的方向和幅度。该指标使用从人类判断差异中派生的成对监督数据进行训练,额外添加一个正则化项,鼓励在候选顺序反转时进行符号反转。在 WMT24 meta-evaluation 基准测试上,PEAR 在使用相同数据和骨干网络的严格匹配单候选 QE 基线之上取得了优势,隔离了所提出成对表述的益处。尽管使用了远小于最新大型指标的参数数量,PEAR 仍超越了更大的 QE 模型和基于参考的指标。我们的分析进一步表明,PEAR 相对于其他顶级指标提供了更少冗余的评估信号。最后,我们展示 PEAR 是最小贝叶斯风险(MBR)解码的有效效用函数,通过降低成对评分成本几乎不影响效果。

关键词

引用

@article{arxiv.2601.18006,
  title  = {PEAR: Pairwise Evaluation for Automatic Relative Scoring in Machine Translation},
  author = {Lorenzo Proietti and Roman Grundkiewicz and Matt Post},
  journal= {arXiv preprint arXiv:2601.18006},
  year   = {2026}
}

备注

ACL 2026 Main Conference. 19 pages