QuickLLaMA: 面向大型语言模型的查询感知推理加速
机器学习
2024-08-23 v2
摘要
大型语言模型理解和推理长上下文的能力对于不同领域的进步至关重要。然而,它们在捕捉序列内的长距离依赖关系以深入理解语义方面仍然存在困难。为了解决这个问题,我们引入了面向大型语言模型的查询感知推理系统 Q-LLM,该系统旨在像人类认知一样处理长序列。通过关注与给定查询相关的记忆数据,Q-LLM 能够在固定窗口大小内准确捕获相关信息,并为查询提供精确答案。它不需要额外训练,并且可以无缝集成到任何 LLM 中。使用 LLaMA3 的 Q-LLM(QuickLLaMA)可以在 30 秒内阅读《哈利·波特》并准确回答问题。在广泛认可的基准测试中,Q-LLM 在 -bench 上相比当前最先进的 LLaMA3 提升了 7.17%,相比 Mistral 提升了 3.26%。在 Needle-in-a-Haystack 和 BABILong 任务中,Q-LLM 相比当前最先进水平分别提升了 7.0% 和 6.1%。我们的代码可在 https://github.com/dvlab-research/Q-LLM 找到。
引用
@article{arxiv.2406.07528,
title = {QuickLLaMA: Query-aware Inference Acceleration for Large Language Models},
author = {Jingyao Li and Han Shi and Xin Jiang and Zhenguo Li and Hong Xu and Jiaya Jia},
journal= {arXiv preprint arXiv:2406.07528},
year = {2024}
}