记忆力强,推理浅:$k$NN语言模型的局限性
计算与语言
2024-08-22 v1 人工智能
摘要
最近邻语言模型(NN-LMs)通过检索与下一个词预测集成,已在语言模型及下游NLP基准测试中展现出强劲性能。这一成果促使研究者认为,模型即使在训练数据质量差或过时的情形下,通过NN扩展访问更高质量的数据存储库也能表现良好。本文探讨这种记忆能力提升是否真正转化为下游能力。我们对NN-LMs进行广泛评估,涵盖情感分类、常识推理及多跳推理等多样化任务。结果表明,NN-LMs在记忆密集型任务中表现出色,即输入模式足以确定输出;但在需要整合多信息以推导新知识的推理任务中则表现不足。我们进一步通过oracle实验和定性分析表明,即便检索完美,NN-LMs仍无法确定正确答案,这为其推理能力设定了上限。代码和数据存储库已发布于https://github.com/GSYfate/knnlm-limits/。
引用
@article{arxiv.2408.11815,
title = {Great Memory, Shallow Reasoning: Limits of $k$NN-LMs},
author = {Shangyi Geng and Wenting Zhao and Alexander M Rush},
journal= {arXiv preprint arXiv:2408.11815},
year = {2024}
}