量化对检索增强生成的影响:小型 LLM 的分析
计算与语言
2024-08-02 v3 人工智能
信息检索
摘要
后训练量化可降低大型语言模型(LLM)的计算需求,但可能削弱其某些能力。由于 LLM 能力随规模而发展,较小的 LLM 对量化更敏感。本文探讨了量化如何影响较小 LLM 执行检索增强生成(RAG)的能力,具体聚焦于较长上下文情境。我们选择个人化任务进行评估,因为该任务在使用 RAG 时具有挑战性,需要对多个文档进行长上下文推理。我们比较原始 FP16 和量化后的 INT4 性能,测试多个 7B 和 8B LLM 在两个任务上的表现,逐步增加检索文档的数量,以测试量化模型在较长上下文中的表现。为更好地理解检索的影响,我们在实验中评估了三个检索模型。我们的发现表明,如果 7B LLM 能良好完成该任务,量化不会损害其性能和长上下文推理能力。我们得出结论,可以利用量化后的较小 LLM 进行 RAG。
引用
@article{arxiv.2406.10251,
title = {The Impact of Quantization on Retrieval-Augmented Generation: An Analysis of Small LLMs},
author = {Mert Yazan and Suzan Verberne and Frederik Situmeang},
journal= {arXiv preprint arXiv:2406.10251},
year = {2024}
}
备注
Accepted to the IR-RAG Workshop at SIGIR 2024