神经序列模型如何泛化?用于分布外预测的局部与全局上下文线索
计算与语言
2021-11-08 v1
摘要
当神经序列模型遇到意外词元后,其行为是否可预测?我们表明,RNN 和 Transformer 语言模型在分布外上下文中表现出结构化且一致的泛化能力。我们首先引入了下一词预测中泛化的两种理想化模型:局部上下文模型(泛化与最后观察到的词一致)和全局上下文模型(泛化与输入的全局结构一致)。在英语、芬兰语、普通话和随机正则语言的实验中,我们证明神经语言模型在这两种泛化形式之间进行插值:它们的预测可以很好地由局部和全局预测分布的对数线性组合来近似。随后我们表明,在某些语言中,噪声介导了这两种泛化形式:施加于输入词元的噪声促进全局泛化,而历史表示中的噪声则促进局部泛化。最后,通过证明在具有特定特征相关结构的对数线性模型中预期会出现所观察到的插值行为,我们为这些结果提供了初步的理论解释。这些结果有助于解释两种流行正则化方案的有效性,并表明序列模型泛化的某些方面是可以被理解和控制的。
引用
@article{arxiv.2111.03108,
title = {How Do Neural Sequence Models Generalize? Local and Global Context Cues for Out-of-Distribution Prediction},
author = {Anthony Bau and Jacob Andreas},
journal= {arXiv preprint arXiv:2111.03108},
year = {2021}
}