基于教师模型细化的强化学习:机器翻译的渐进式模仿学习
计算与语言
2025-12-22 v3 人工智能
摘要
机器翻译中的偏好学习方法,如直接偏好优化(DPO),虽然取得了显著的改进,但通常依赖于大规模精心策划的偏好三元组,并且往往难以在调优领域之外获得良好泛化。我们提出了一种名为强化学习从教师模型细化(RLfR)的方法,取而代之的是由冻结教师生成的基于策略的、演员条件化的细化。在每一步中,演员抽样候选翻译,教师对每个草稿进行最小的局部编辑,然后演员学习缩小编辑距离,以复合奖励函数引导,其中结合了用于词汇和结构保真度的缩放负编辑距离与用于语义 adequacy 的 COMET。该 formulation 能产生稳定、模型感知的学习信号,而无需显式的偏好数据集。在FLORES-200(英语到德语、西班牙语、中文、韩语和日语)上的实验表明,RLfR 在所有强大的MT-SFT、DPO和固定参考RL基线上均表现出色,提升了语义质量和实体保留,同时在基于LLM的评判员评估中也取得了优异性能。
引用
@article{arxiv.2507.22219,
title = {RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation},
author = {Dongyub Jude Lee and Zhenyi Ye and Pengcheng He},
journal= {arXiv preprint arXiv:2507.22219},
year = {2025}
}