刻画并解决神经自回归序列建模中的过平滑问题
机器学习
2021-12-23 v2 计算与语言
摘要
神经自回归序列模型将概率散布于许多可能的序列(包括退化的序列,如空序列或重复序列)之中。在本工作中,我们处理一个具体情形:模型对不合理短序列赋予高概率。我们定义过平滑率来量化此问题。在确认神经机器翻译中存在高度过平滑后,我们提出在训练期间显式最小化过平滑率。我们进行了一组实验来研究所提正则化对模型分布和解码性能的影响。我们使用神经机器翻译任务作为测试平台,并考虑三个不同大小的 dataset。我们的实验揭示了三个主要发现。第一,我们可以通过调节正则化强度来控制模型的过平滑率。第二,通过增强过平滑损失贡献,<eos> token 在不该出现的位置上的概率和排名大幅下降。第三,所提正则化影响束搜索的结果,尤其在使用大束时。使用大束时翻译质量(以 BLEU 衡量)的下降随过平滑率降低而显著减轻,但相较于较小束大小的下降仍然存在。由这些观察我们得出结论:高度过平滑是神经自回归模型中过短序列概率过高的退化情况的主要原因。
引用
@article{arxiv.2112.08914,
title = {Characterizing and addressing the issue of oversmoothing in neural autoregressive sequence modeling},
author = {Ilia Kulikov and Maksim Eremeev and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2112.08914},
year = {2021}
}
备注
Ilia Kulikov and Maksim Eremeev contributed equally