基于直接质量优化的神经机器翻译交叉语言人类偏好对齐
计算与语言
2025-09-30 v3
摘要
强化学习从人类反馈(RLHF)以及像直接偏好优化(DPO)这样的衍生技术是用于将通用基础模型重新定位以适应特定任务的任务对齐算法。我们展示了将任务对齐应用于神经机器翻译(NMT)解决了一个现存问题——NMT 中的数据与任务不匹配,导致该方法在多语言模型的所有语言上都取得改进,即使该任务对齐仅应用于其中一些语言。为此,我们引入了直接质量优化(DQO),这是一种变体 DPO,利用预训练的翻译质量评估模型作为人类偏好的代理,并通过自动度量和人类评估验证了改进效果。
引用
@article{arxiv.2409.17673,
title = {Cross-lingual Human-Preference Alignment for Neural Machine Translation with Direct Quality Optimization},
author = {Kaden Uhlig and Joern Wuebker and Raphael Reinauer and John DeNero},
journal= {arXiv preprint arXiv:2409.17673},
year = {2025}
}
备注
21 pages, 4 figures