最近邻语言模型为何有效?
计算与语言
2023-01-18 v2 机器学习
摘要
语言模型 (LMs) 通过顺序计算已见上下文的表示并利用该表示预测下一个词来计算文本的概率。目前,大多数 LM 通过消耗紧邻前文上下文的神经网络来计算这些表示。然而最近,检索增强 LM 已显示出优于标准神经 LM,其除了标准的、参数的下一词预测外,还能访问从大型数据存储中检索的信息。在本文中,我们着手理解为何检索增强语言模型,具体而言为何 k-最近邻语言模型 (kNN-LMs) 优于标准参数 LM,即使 k-最近邻组件从 LM 最初训练所用的同一训练集中检索示例。为此,我们对 kNN-LM 区别于标准 LM 的各个维度进行细致分析,并逐一考察这些维度。通过实证,我们确定了 kNN-LM 优于标准 LM 的三个主要原因:使用不同的输入表示来预测下一词元、近似 kNN 搜索,以及 softmax 温度对 kNN 分布的重要性。进一步,我们将这些见解融入标准参数 LM 的模型架构或训练过程中,在不需显式检索组件的情况下改进了其结果。代码可在 https://github.com/frankxu2004/knnlm-why 获取。
引用
@article{arxiv.2301.02828,
title = {Why do Nearest Neighbor Language Models Work?},
author = {Frank F. Xu and Uri Alon and Graham Neubig},
journal= {arXiv preprint arXiv:2301.02828},
year = {2023}
}
备注
Preprint, 21 pages