中文

PEGRL: 基于后编辑引导的强化学习改进机器翻译

计算与语言 2026-05-19 v2

摘要

强化学习 (RL) 已在 LLM-based 机器翻译中显示出强大的潜力,如 GRPO 等方法取得了显著进步;然而,翻译导向的 RL 仍面临蒙特卡洛返回估计产生的噪声学习信号,以及大轨迹空间倾向于全局探索而非细粒度局部优化的挑战。我们引入 PEGRL,一个两阶段 RL 框架,使用后编辑作为辅助任务来稳定训练并指导整体优化。在每个迭代中,采样翻译输出以构建后编辑输入, allowing 在后编辑阶段利用对当前翻译行为的条件化来获得更好的返回估计,同时同时支持全局探索和细粒度局部优化。一种任务特定的加权方案进一步平衡了翻译和后编辑目标的贡献,yielding 一个有偏但更具样本效率的估计器。在英语→芬兰语、英语→土耳其语和英语↔中文上的实验显示,PEGRL 在 RL baseline 上 consistently 获得提升,而对于英语→土耳其语,在 COMET-KIWI 上的性能与先进 LLM-based 系统相当(DeepSeek-V3.2)。我们的代码和一套代表性预训练模型已公开于 \url{https://github.com/NJUNLP/peg-rl} 和 \url{https://huggingface.co/collections/DGME/pegrl}。

关键词

引用

@article{arxiv.2602.03352,
  title  = {PEGRL: Improving Machine Translation by Post-Editing Guided Reinforcement Learning},
  author = {Yunzhi Shen and Hao Zhou and Xin Huang and Xue Han and Junlan Feng and Shujian Huang},
  journal= {arXiv preprint arXiv:2602.03352},
  year   = {2026}
}