利用强化学习优化多语言NMT训练计划
计算与语言
2025-06-03 v2
摘要
多语言NMT是一种可行方案,用于翻译数据资源匮乏的语言(LRLs),当高资源语言(HRLs)来自同一语言族时可用其数据。然而,训练计划即语言呈现顺序,对系统质量有一定影响。本文在许多对一翻译设置下,提出两种使用强化学习优化NMT训练计划的算法:(1) Teacher-Student课程学习;(2)深度Q网络。前者基于在单语或多语开发子集上的损失,对每个动作的回报进行指数平滑估计;后者使用额外的神经网络从系统不同状态下所选动作的历史及所获奖励来估计奖励。在8语言对1翻译数据集上,我们的方法在调整LRL与HRL批次呈现次数后,相对于随机选择单语批次和混洗多语批次,BLEU和COMET分数均得到提升。
引用
@article{arxiv.2410.06118,
title = {Optimizing the Training Schedule of Multilingual NMT using Reinforcement Learning},
author = {Alexis Allemann and Àlex R. Atrio and Andrei Popescu-Belis},
journal= {arXiv preprint arXiv:2410.06118},
year = {2025}
}
备注
Proceedings of MT Summit 2025