中文

缓解最小贝叶斯风险解码中的度量偏差

计算与语言 2024-11-07 v1 人工智能

摘要

虽然使用 COMET 或 MetricX 等度量的最小贝叶斯风险(MBR)解码已优于贪婪搜索或束搜索等传统解码方法,但它引入了一个我们称之为度量偏差的挑战。由于 MBR 解码旨在产生根据特定效用度量得分高的翻译,这一过程本身使得无法将同一度量同时用于解码和评估,因为改进可能仅仅是由于奖励黑客行为,而不是反映真实的质量提升。在这项工作中,我们发现与人类评分相比,当同一度量被用作效用度量时,神经度量不仅高估了 MBR 解码的质量,而且它们也高估了使用其他神经效用度量的 MBR/QE 解码的质量。我们还表明,通过在 MBR 解码期间使用效用度量集成可以缓解度量偏差问题:人工评估表明,使用效用度量集成的 MBR 解码优于单个效用度量。

关键词

引用

@article{arxiv.2411.03524,
  title  = {Mitigating Metric Bias in Minimum Bayes Risk Decoding},
  author = {Geza Kovacs and Daniel Deutsch and Markus Freitag},
  journal= {arXiv preprint arXiv:2411.03524},
  year   = {2024}
}

备注

To appear at WMT2024