LightTransfer:长上下文大语言模型实为轻量级混合模型,轻松适配
计算与语言
2026-05-19 v3 人工智能
机器学习
摘要
将语言模型扩展以处理更长的上下文会因键值 (KV) 缓存的增长而带来巨大的内存挑战。鼓励混合模型的效率优势以及预训练大型 transformer 主干模型的广泛可用性,我们探索将 transformer 模型过渡为混合架构以实现更高效的生成。在本工作中,我们提出了 LightTransfer,一种轻量级方法,可将模型如 LLaMA 转换为混合变体。我们的方案识别关注最近或初始标记的“懒散”层,并用流式注意力替换其完整注意力。这一转换可以在不进行长上下文理解任务训练的情况下进行,或针对需要更强推理能力的 o1 类长推理生成任务进行最小微调。实验在多样化基准和模型(如 LLaMA、Mistral、QwQ-STILL)上进行,显示即使将约一半的层识别为懒散层,LightTransfer 也能在长期基准上实现最高 2.17 倍的吞吐量提升,同时保持最小性能损失(<1.5%),并在先进 o1 类长推理模型 QwQ-STILL 上实现 53.3% 的数学基准 AIME24 成绩。
引用
@article{arxiv.2410.13846,
title = {LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation},
author = {Xuan Zhang and Fengzhuo Zhang and Cunxiao Du and Chao Du and Tianyu Pang and Wei Gao and Min Lin},
journal= {arXiv preprint arXiv:2410.13846},
year = {2026}
}
备注
Accepted by TMLR 2025