大语言模型难以学习长尾知识
计算与语言
2023-07-28 v2 机器学习
摘要
互联网蕴含丰富的知识——从历史人物的生日到编程教程——所有这些都可能被语言模型学到。然而,尽管某些信息在网络上无处不在,其他信息却极为罕见。在本文中,我们研究了大语言模型所记忆的知识与从网络抓取预训练数据集中的信息之间的关系。具体而言,我们表明语言模型回答基于事实问题的能力与其在预训练期间看到的与该问题相关的文档数量有关。我们通过实体链接预训练数据集并统计包含与给定问答对相同实体的文档来识别这些相关文档。我们的结果展示了众多问答数据集(如 TriviaQA)、预训练语料库(如 ROOTS)和模型规模(如 176B 参数)下准确率与相关文档数量之间的强相关和因果关系。此外,虽然更大的模型更擅长学习长尾知识,我们估计当今的模型必须扩大许多数量级才能在预训练数据中支持很少的问题上达到有竞争力的问答性能。最后,我们表明检索增强可以减少对相关预训练信息的依赖,为捕捉长尾提供了一种有前景的方法。
引用
@article{arxiv.2211.08411,
title = {Large Language Models Struggle to Learn Long-Tail Knowledge},
author = {Nikhil Kandpal and Haikang Deng and Adam Roberts and Eric Wallace and Colin Raffel},
journal= {arXiv preprint arXiv:2211.08411},
year = {2023}
}
备注
ICML 2023 Camera Ready Version