论检索增强与语言模型训练的局限性
计算与语言
2024-04-03 v2
摘要
仅在其训练数据上用 近邻 (NN) 检索增强语言模型 (LM) 可降低其困惑度,尽管其背后的原因仍不清楚。在本工作中,我们排除了一种先前提出的解释——"softmax 瓶颈"。随后我们构建了一个新的数据集,用于在训练数据包含非因果相关额外信息的设定下评估 LM 的泛化能力。即便对 GPT-3.5 Turbo 而言,该任务也具有挑战性。我们表明,对于 GPT-2 和 Mistral 7B,NN 检索增强在此设定下始终能提升性能。最后,为使 NN 检索更易使用,我们提出使用多层感知机模型将数据存储键映射到值,作为传统检索的即插即用替代方案。这将存储成本降低了 25 倍以上。
引用
@article{arxiv.2311.09615,
title = {On Retrieval Augmentation and the Limitations of Language Model Training},
author = {Ting-Rui Chiang and Xinyan Velocity Yu and Joshua Robinson and Ollie Liu and Isabelle Lee and Dani Yogatama},
journal= {arXiv preprint arXiv:2311.09615},
year = {2024}
}
备注
Accepted to NAACL 2024