中文

COMET-poly:基于其他候选方案的机器翻译评估指标

计算与语言 2025-08-27 v1

摘要

机器翻译的自动评估指标旨在复制人类判断。不同于人类常在多种备选方案的上下文中评估翻译,这些指标通常仅考虑源句子与单一翻译。这种评估 setup 的差异可能对自动化指标的性能产生负面影响。我们提出两种新的自动化指标,融合除单一翻译外的额外信息。COMET-polycand 利用相同源句子的备选翻译与待评估翻译进行比较和对比,从而对其质量提供更有信息的评估。COMET-polyic 受检索式情境学习(retrieval-based in-context learning)启发,接收类似源文本的翻译及其人工标记质量分数,以指导评估。我们发现,在 COMET-polycand 中引入单个额外翻译即可提升分段级指标性能(Kendall's tau-b 相关系数从 0.079 提升至 0.118),当更多翻译被添加后,改进幅度进一步提升。将检索到的示例纳入 COMET-polyic 也取得类似效果(Kendall's tau-b 相关系数从 0.079 提升至 0.116)。我们将公开发布这些模型。

关键词

引用

@article{arxiv.2508.18549,
  title  = {COMET-poly: Machine Translation Metric Grounded in Other Candidates},
  author = {Maike Züfle and Vilém Zouhar and Tu Anh Dinh and Felipe Maia Polo and Jan Niehues and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2508.18549},
  year   = {2025}
}

备注

Maike Z\"ufle, Vil\'em Zouhar, and Tu Anh Dinh contributed equally