中文

论检索增强与语言模型训练的局限性

计算与语言 2024-04-03 v2

摘要

仅在其训练数据上用 kk 近邻 (kkNN) 检索增强语言模型 (LM) 可降低其困惑度,尽管其背后的原因仍不清楚。在本工作中,我们排除了一种先前提出的解释——"softmax 瓶颈"。随后我们构建了一个新的数据集,用于在训练数据包含非因果相关额外信息的设定下评估 LM 的泛化能力。即便对 GPT-3.5 Turbo 而言,该任务也具有挑战性。我们表明,对于 GPT-2 和 Mistral 7B,kkNN 检索增强在此设定下始终能提升性能。最后,为使 kkNN 检索更易使用,我们提出使用多层感知机模型将数据存储键映射到值,作为传统检索的即插即用替代方案。这将存储成本降低了 25 倍以上。

关键词

引用

@article{arxiv.2311.09615,
  title  = {On Retrieval Augmentation and the Limitations of Language Model Training},
  author = {Ting-Rui Chiang and Xinyan Velocity Yu and Joshua Robinson and Ollie Liu and Isabelle Lee and Dani Yogatama},
  journal= {arXiv preprint arXiv:2311.09615},
  year   = {2024}
}

备注

Accepted to NAACL 2024