AdaSkip:面向长上下文 LLM 推理加速的自适应子层跳过方法
计算与语言
2025-01-07 v1 人工智能
摘要
长上下文大语言模型(LLM)推理日益重要,这促使众多研究致力于缓解此类场景下巨大的存储与计算开销。逐层跳过方法是一类颇具前景的优化手段,但在长上下文推理中却鲜有探索。我们观察到,现有逐层跳过策略在应用于长上下文推理时存在若干局限,包括无法适应模型与上下文的多样性、忽视子层的重要性,以及不适用于预填充阶段。本文提出 \sysname,一种专为长上下文推理设计的自适应子层跳过方法。\sysname 通过利用在线相似度信息自适应地识别较不重要的层,实现子层粒度的跳过,并同时加速预填充阶段与解码阶段。通过在多种长上下文基准和模型上的大量实验,证明了 \sysname 的有效性,展示了其相较于现有基线的优越推理性能。
引用
@article{arxiv.2501.02336,
title = {AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference},
author = {Zhuomin He and Yizhen Yao and Pengfei Zuo and Bin Gao and Qinya Li and Zhenzhe Zheng and Fan Wu},
journal= {arXiv preprint arXiv:2501.02336},
year = {2025}
}
备注
9 pages,10 figures, AAAI