中文

训练过的机器翻译指标学会应对机器翻译的参考译文

计算与语言 2023-12-04 v1

摘要

基于人工评估训练的神经指标往往与人工判断有很好的相关性,但其行为尚未被完全理解。在本文中,我们进行了一项受控实验,将未经过人工评估训练的基线指标(Prism)与同一指标的训练版本(Prism+FT)进行比较。令人惊讶的是,我们发现Prism+FT对机器翻译的参考译文变得更加鲁棒,而机器翻译的参考译文是机器翻译评估中一个臭名昭著的问题。这表明指标训练的效果超出了提高与人工判断整体相关性的预期效果。

关键词

引用

@article{arxiv.2312.00536,
  title  = {Trained MT Metrics Learn to Cope with Machine-translated References},
  author = {Jannis Vamvas and Tobias Domhan and Sony Trenous and Rico Sennrich and Eva Hasler},
  journal= {arXiv preprint arXiv:2312.00536},
  year   = {2023}
}

备注

WMT 2023