基于最小贝叶斯风险解码的神经机器翻译直接偏好优化
计算与语言
2024-04-15 v2
摘要
最小贝叶斯风险(MBR)解码能显著提升多语言大语言模型(MLLMs)的翻译性能。然而,MBR解码计算开销大。我们展示了近期开发的强化学习技术——直接偏好优化(DPO)——如何微调MLLMs,以在推理中无需额外计算即可获得MBR的收益。我们的方法仅使用小型单语微调集,相较于未使用DPO的MLLMs,在多个NMT测试集上取得了显著改进的性能。
引用
@article{arxiv.2311.08380,
title = {Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding},
author = {Guangyu Yang and Jinghong Chen and Weizhe Lin and Bill Byrne},
journal= {arXiv preprint arXiv:2311.08380},
year = {2024}
}
备注
To appear at NAACL 2024