中文

基于最小贝叶斯风险解码的神经机器翻译直接偏好优化

计算与语言 2024-04-15 v2

摘要

最小贝叶斯风险(MBR)解码能显著提升多语言大语言模型(MLLMs)的翻译性能。然而,MBR解码计算开销大。我们展示了近期开发的强化学习技术——直接偏好优化(DPO)——如何微调MLLMs,以在推理中无需额外计算即可获得MBR的收益。我们的方法仅使用小型单语微调集,相较于未使用DPO的MLLMs,在多个NMT测试集上取得了显著改进的性能。

关键词

引用

@article{arxiv.2311.08380,
  title  = {Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding},
  author = {Guangyu Yang and Jinghong Chen and Weizhe Lin and Bill Byrne},
  journal= {arXiv preprint arXiv:2311.08380},
  year   = {2024}
}

备注

To appear at NAACL 2024