中文

基于错误严重度映射的机器翻译细粒度奖励优化

计算与语言 2025-11-24 v3

摘要

强化学习(RL)已被证明是训练神经机器翻译系统的有效且鲁棒的方法,特别是当与能够准确评估翻译质量的强大奖励模型配对时。然而,大多数研究集中于使用句子级反馈的RL方法,导致学习信号效率低下——奖励稀疏问题,即模型对整个句子仅获得一个分数。为解决这一问题,我们提出了一种利用细粒度、词元级质量评估结合错误严重度等级的RL方法。具体而言,我们使用最先进的质量估计系统xCOMET作为词元级奖励模型。我们在小型和大型翻译数据集上,针对标准编码器-解码器和大语言模型驱动的机器翻译系统进行了实验,比较了句子级与细粒度奖励信号对翻译质量的影响。结果表明,使用词元级奖励训练在不同语言对上均优于基线,提升了翻译质量。此外,词元级奖励优化改善了训练稳定性,表现为训练轮次中平均奖励的稳步增长。

关键词

引用

@article{arxiv.2411.05986,
  title  = {Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings},
  author = {Miguel Moura Ramos and Tomás Almeida and Daniel Vareta and Filipe Azevedo and Sweta Agrawal and Patrick Fernandes and André F. T. Martins},
  journal= {arXiv preprint arXiv:2411.05986},
  year   = {2025}
}