中文

具有模仿损失的动态计划采样用于神经文本生成

计算与语言 2023-02-01 v1

摘要

最先进的神经文本生成模型通常训练为最大化真实序列中每个 token 在给定前序目标 token 条件下的似然。然而,在推理期间,模型需要基于其自身生成的 token 进行预测。这种训练-测试差异被称为暴露偏差。计划采样是一种课程学习策略,在训练期间逐渐使模型接触其自身预测以缓解此偏差。大多数已有方法基于训练步设计调度器,通常需要根据训练设置仔细调参。在本工作中,我们提出具有模仿损失的动态计划采样(DySI),它仅基于训练时准确率维持调度,同时通过引入模仿损失增强课程学习,该损失试图使解码器的行为与被强制教师解码器的行为不可区分。DySI 在极少调参下普遍适用于各种训练设置。大量实验与分析表明,DySI 不仅在标准机器翻译基准上取得显著提升,还显著增强了其他文本生成模型的鲁棒性。

关键词

引用

@article{arxiv.2301.13753,
  title  = {Dynamic Scheduled Sampling with Imitation Loss for Neural Text Generation},
  author = {Xiang Lin and Prathyusha Jwalapuram and Shafiq Joty},
  journal= {arXiv preprint arXiv:2301.13753},
  year   = {2023}
}