中文

用于机器翻译中鲁棒强化学习的 MAD 算法

计算与语言 2022-07-19 v1

摘要

我们引入一种新的分布式策略梯度算法,并表明在优化机器翻译模型时,其在训练稳定性和泛化性能方面优于现有的奖励感知训练过程,如 REINFORCE、最小风险训练(MRT)和近端策略优化(PPO)。我们的算法称为 MAD(因在重要性权重计算中使用平均绝对偏差而得名),其具有分布式数据生成器在 worker 节点上对每个源句采样多个候选,而中央学习器更新策略。MAD 关键依赖于两种方差缩减策略:(1)一种条件奖励归一化方法,确保每源句同时具有正奖励与负奖励翻译样本;(2)一种新的鲁棒重要性加权方案,充当条件熵正则化器。在多种翻译任务上的实验表明,使用 MAD 算法学习的策略在贪心解码和束搜索下均表现优异,且所学策略对训练期间所用的特定奖励敏感。

关键词

引用

@article{arxiv.2207.08583,
  title  = {MAD for Robust Reinforcement Learning in Machine Translation},
  author = {Domenic Donato and Lei Yu and Wang Ling and Chris Dyer},
  journal= {arXiv preprint arXiv:2207.08583},
  year   = {2022}
}