面向低热门知识的微调与检索增强生成比较
计算与语言
2024-12-03 v5
摘要
语言模型(LM)记忆了大量事实知识,在各种任务和领域中表现出强大的性能。然而,已观察到在处理不热门或低频概念和实体时,性能会下降,例如在特定领域的应用中。两种提高 LM 在低频主题方面性能的主要方法是检索增强生成(RAG)和对合成数据的微调(FT)。本文探索和评估了 RAG 和 FT 对 LM 处理低频实体在问答任务中的影响。我们在十二个规模和类型的 LM 上进行了大量实验,并使用不同的微调、数据增强和检索模型。我们的发现表明,尽管 FT 在各种流行度的实体上都能提升性能,但 RAG 在最不热门的事实知识方面显著优于 FT。此外,RAG 和 FT 方法的成功也会通过改进检索和数据增强技术而被放大。微调虽然对小型 LM 有益,但需要大量资源。为解决此问题,我们提出了新的 Stimulus RAG 方法,超过基于微调的方法的有效性,从而消除了为丰富 LM 的低热门事实知识所需的昂贵数据增强和微调步骤。代码地址为 \url{https://github.com/informagi/RAGvsFT}。
引用
@article{arxiv.2403.01432,
title = {Fine Tuning vs. Retrieval Augmented Generation for Less Popular Knowledge},
author = {Heydar Soudani and Evangelos Kanoulas and Faegheh Hasibi},
journal= {arXiv preprint arXiv:2403.01432},
year = {2024}
}