对齐神经机器翻译模型:训练与推理中的人类反馈
计算与语言
2024-07-08 v2
摘要
基于人类反馈的强化学习(RLHF)是一种近期技术,用于提升语言模型生成文本的质量,使其更贴近人类所生成的文本。RLHF 在对齐并改进大语言模型(LLMs)方面取得成功的一个核心要素是其奖励模型,该模型利用人类对模型输出的反馈进行训练。在机器翻译(MT)领域,由人类标注训练得到的指标可轻易用作奖励模型,近期采用最小贝叶斯风险解码与重排序的方法已成功提升翻译的最终质量。在本研究中,我们全面探索并比较了将质量指标作为奖励模型整合进 MT 流程的技术。这包括在训练阶段通过 RL 使用奖励模型进行数据过滤,以及在推理时采用重排序技术,并评估将这些方法结合于统一方案中的效果。我们在多个翻译任务上的实验结果表明,基于估计质量的有效数据过滤在发挥 RL 提升 MT 质量的全部潜力中起着关键作用。此外,我们的发现证明了将 RL 训练与重排序技术相结合的有效性,展示了翻译质量的显著提升。
引用
@article{arxiv.2311.09132,
title = {Aligning Neural Machine Translation Models: Human Feedback in Training and Inference},
author = {Miguel Moura Ramos and Patrick Fernandes and António Farinhas and André F. T. Martins},
journal= {arXiv preprint arXiv:2311.09132},
year = {2024}
}
备注
EAMT 2024