何时不应信任语言模型:探究参数化与非参数化记忆的有效性
计算与语言
2023-07-04 v4 人工智能
机器学习
摘要
尽管大型语言模型(LM)在各类任务上表现出色,但在需要丰富世界知识的任务上仍然存在困难,这表明仅依靠其参数来编码大量世界知识具有局限性。本文旨在通过在 PopQA(我们新构建的包含 1.4 万个问题的开放域 QA 数据集)上对 10 个模型和 4 种增强方法进行大规模知识探测实验,以理解 LM 在记忆事实知识方面的优势与局限。我们发现 LM 在处理不那么流行的事实知识时存在困难,且扩展模型规模未能显著改善对长尾事实知识的记忆。我们进而表明,检索增强的 LM 大幅优于规模大其数个数量级的 LM,而在关于高流行度实体的问题上,无辅助的 LM 仍具竞争力。基于这些发现,我们设计了一种简单而有效的方法,用于构建强大且高效的检索增强 LM,该方法仅在必要时检索非参数化记忆。实验结果表明,这在降低推理成本的同时显著提升了模型的性能。
引用
@article{arxiv.2212.10511,
title = {When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories},
author = {Alex Mallen and Akari Asai and Victor Zhong and Rajarshi Das and Daniel Khashabi and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2212.10511},
year = {2023}
}
备注
ACL 2023; Code and data available at https://github.com/AlexTMallen/adaptive-retrieval