LoRA-Drop:用于高效LLM推理的时序LoRA解码
计算与语言
2026-01-07 v1
摘要
自回归大语言模型(LLMs)受限于顺序解码,每个新标记通常需要执行所有转换层。现有的动态深度和层跳过方法降低了这种成本,但常依赖辅助路由机制,或在跳过的层未被补偿时导致精度下降。我们提出了\textbf{LoRA-Drop},一个即插即用的推理框架,通过对固定子集中间层应用\emph{时序计算计划}来加速解码:在大多数解码步骤中,选定层复用前一标记的隐藏状态并应用低秩LoRA校正,而在周期性\emph{刷新}步骤中执行完整模型以防止漂移。LoRA-Drop无需路由网络,兼容标准KV缓存,可通过在LoRA步骤中跳过KV更新来降低KV缓存占用并定期刷新。对于\textbf{LLaMA2-7B}、\textbf{LLaMA3-8B}、\textbf{Qwen2.5-7B}和\textbf{Qwen2.5-14B},LoRA-Drop实现了最高可达\textbf{2.6倍}的解码加速和\textbf{45--55\%}的KV缓存降低,同时保持在基线准确率水平以下\textbf{0.5个百分点}。在推理(GSM8K、MATH、BBH)、代码生成(HumanEval、MBPP)以及长上下文/多语言基准(LongBench、XNLI、XCOPA)的评估中,确定了一组持续的\emph{安全区}调度配置,在保持质量的同时实现显著的效率提升,为LLM提供了一条简单实现自适应容量推理的路径。代码已在https://github.com/hosseinbv/LoRA-Drop.git提供。
引用
@article{arxiv.2601.02569,
title = {LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference},
author = {Hossein Rajabzadeh and Maryam Dialameh and Chul B. Park and Il-Min Kim and Hyock Ju Kwon},
journal= {arXiv preprint arXiv:2601.02569},
year = {2026}
}