RNN 语言模型的词元级与序列级损失平滑
计算与语言
2018-05-15 v1 计算机视觉与模式识别
摘要
尽管循环神经网络语言模型行之有效,其极大似然估计存在两个局限性。首先,它将所有与真实值不匹配的句子视为同等糟糕,忽略了输出空间的结构。其次,它存在“暴露偏差”:在训练阶段,词元是在给定真实序列的条件下进行预测的;而在测试阶段,预测则以生成的输出序列为条件。为了克服这些局限性,我们基于最近的奖励增强极大似然方法,即序列级平滑,该方法鼓励模型根据给定的性能指标预测接近真实值的句子。我们将该方法扩展至词元级损失平滑,并对序列级平滑方法提出了改进。我们在图像描述和机器翻译两个不同任务上的实验表明,词元级和序列级损失平滑是互补的,并能显著改善结果。
引用
@article{arxiv.1805.05062,
title = {Token-level and sequence-level loss smoothing for RNN language models},
author = {Maha Elbayad and Laurent Besacier and Jakob Verbeek},
journal= {arXiv preprint arXiv:1805.05062},
year = {2018}
}
备注
Accepted by ACL 2018