中文

RIVAL:基于迭代对抗优化的强化学习机器翻译

计算与语言 2025-08-06 v2

摘要

大语言模型(LLMs)具有强大的多语言能力,将强化学习来自人类反馈(RLHF)与翻译任务结合显示出巨大的潜力。然而,我们注意到这一范式在应用于口语字幕翻译任务时表现出意外的差励。在本工作中,我们调查了这一问题,发现离线奖励模型(RM)由于分布性偏移而逐渐偏离在线LLM,最终导致不可取的训练结果。为此,我们提出RIVAL,一种对抗训练框架,将过程建模为RM与LLM之间的min-max博弈。RIVAL迭代更新两者,其中RM训练以区分强弱翻译(定性偏好奖励),LLM训练以增强其翻译以缩小这一差距。为稳定训练并提高通用性,我们还将定量偏好奖励(例如BLEU)纳入RM中,实现无参考质量建模并与人类评估一致。通过大量实验,我们展示了所提出的对抗训练框架显著优于翻译基线。

关键词

引用

@article{arxiv.2506.05070,
  title  = {RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translation},
  author = {Tianjiao Li and Mengran Yu and Chenyu Shi and Yanjun Zhao and Xiaojing Liu and Qiang Zhang and Qi Zhang and Xuanjing Huang and Jiayin Wang},
  journal= {arXiv preprint arXiv:2506.05070},
  year   = {2025}
}