检索是帮助还是伤害?对语言模型检索增强效果的深入探究
计算与语言
2024-03-29 v3
摘要
虽然大型语言模型(LM)表现出卓越的性能,但当查询超出其预训练记忆的信息时,它们在提供准确回答方面面临挑战。尽管用相关外部信息增强它们可以缓解这些问题,但未能考虑检索的必要性可能会对整体性能产生不利影响。以往的研究主要关注实体如何影响检索模型和LM中的知识回忆,而其他方面相对未被探索。在这项工作中,我们的目标是通过探索实体和关系组合的影响,提供更细粒度的、以事实为中心的分析。为此,我们构建了一个新的问答(QA)数据集,称为WiTQA(Wikipedia Triple Question Answers)。该数据集包含关于不同流行度级别的实体和关系的问题,每个问题都附有一个支持段落。我们使用多种LM和检索器进行的广泛实验揭示了从以事实为中心的流行度角度来看,检索并不总是能一致地增强LM。确认了早期的发现,我们观察到较大的LM在回忆流行事实方面表现出色。然而,与检索器相比,它们在处理不常见的实体-关系对时明显遇到困难。有趣的是,它们可以有效地保留不太常见实体的流行关系。我们通过一个自适应检索系统展示了我们更细粒度度量和见解的有效性,该系统根据问题中实体和关系的频率选择性地使用检索和回忆。
引用
@article{arxiv.2402.13492,
title = {Retrieval Helps or Hurts? A Deeper Dive into the Efficacy of Retrieval Augmentation to Language Models},
author = {Seiji Maekawa and Hayate Iso and Sairam Gurajada and Nikita Bhutani},
journal= {arXiv preprint arXiv:2402.13492},
year = {2024}
}
备注
NAACL2024 (main)