中文

利用人类反馈改进机器翻译:基于质量估计作为奖励模型的探索

计算与语言 2024-03-19 v3 人工智能

摘要

奖励模型中对人类偏好的建模不足,是利用人类反馈来改进翻译质量的主要障碍。幸运的是,质量估计(QE)在无需参考的情况下预测给定翻译的质量,在过去两年中实现了与人类评估的出色对齐。在这项工作中,我们研究了采用 QE 模型作为奖励模型来预测人类偏好以进行反馈训练的潜力。我们首先识别了基于 QE 的反馈训练过程中的过度优化问题,表现为奖励增加而翻译质量下降。我们对该问题进行了检验,并认为 QE 模型的脆弱性可能会导致错误翻译获得高奖励,进而引发过度优化和错误传播。为了解决该问题,我们采用了一种简单而有效的方法,使用启发式规则检测错误翻译,并对其奖励分数赋予惩罚项。实验结果表明,我们提出的基于 QE 的反馈训练在各种设置下均取得了一致且显著的提升,这一点进一步通过人类偏好研究得到了验证。我们后续的分析证明了所提出的基于 QE 的反馈训练具有很高的数据效率:它仅用少量单语数据便胜过了使用更大型平行语料库的系统。我们的代码可在以下地址获取:https://github.com/zwhe99/FeedbackMT

关键词

引用

@article{arxiv.2401.12873,
  title  = {Improving Machine Translation with Human Feedback: An Exploration of Quality Estimation as a Reward Model},
  author = {Zhiwei He and Xing Wang and Wenxiang Jiao and Zhuosheng Zhang and Rui Wang and Shuming Shi and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2401.12873},
  year   = {2024}
}

备注

NAACL 2024