IAM:通过不同规模 LLM 间的注意力映射实现高效推理
计算与语言
2025-07-17 v1 机器学习
摘要
如今,LLM 在资源消耗方面面临重大挑战,尤其是在长上下文情况下。尽管已有大量致力于提升推理效率的工作,但这些方法主要利用模型内部的稀疏性,而未利用外部信息进行优化。我们发现不同规模 LLM 间的注意力矩阵具有高度相似性,这为优化提供了新视角。我们首先全面分析了如何度量相似性、如何选择映射层以及映射是否具有一致性。基于这些见解,我们引入了 IAM 框架,通过在小规模和大规模 LLM 之间执行注意力映射,实现了加速注意力计算和减少 KV cache 使用的双重收益。我们的实验结果表明,IAM 能在不显著牺牲性能的情况下,将 prefill 加速 15%,并将 KV cache 使用量减少 22.1%。在不同系列模型上的实验展示了 IAM 的泛化能力。重要的是,它与许多现有的 KV cache 优化方法正交,使其成为当前提升 LLM 效率工具包的通用补充。
引用
@article{arxiv.2507.11953,
title = {IAM: Efficient Inference through Attention Mapping between Different-scale LLMs},
author = {Yi Zhao and Zuchao Li and Hai Zhao},
journal= {arXiv preprint arXiv:2507.11953},
year = {2025}
}
备注
ACL 2025