中文

InfLLM-V2:用于无缝短到长适应的稠密-稀疏可切换注意力

计算与语言 2025-09-30 v1 人工智能 机器学习

摘要

长序列处理是现代大型语言模型的关键能力。然而,标准 Transformer 架构中的自注意力机制在处理长序列时面临严重的计算和内存瓶颈。虽然可训练稀疏注意力方法提供了一个有前景的解决方案,但现有方法(如 NSA)引入了过多的额外参数,并打破了传统的“短序列预训练、长序列微调”工作流,导致收敛缓慢且难以加速。为了克服这些限制,我们引入了稠密-稀疏可切换注意力框架,称为 InfLLM-V2。InfLLM-V2 是一种可训练的稀疏注意力,能够无缝地将模型从短序列适应到长序列。具体而言,InfLLM-V2 通过无参数架构修改重用稠密注意力参数,保持了短序列和长序列处理之间的一致性。此外,InfLLM-V2 通过对短输入使用稠密注意力并平滑过渡到对长序列使用稀疏注意力,确保了在所有序列长度上的计算效率。为了实现实际加速,我们进一步引入了 InfLLM-V2 的高效实现,显著降低了计算开销。我们在长上下文理解和思维链推理上的实验表明,InfLLM-V2 比稠密注意力快 4 倍,同时分别保留了 98.1% 和 99.7% 的性能。基于 InfLLM-V2 框架,我们训练并开源了混合推理模型 MiniCPM4.1 (https://huggingface.co/openbmb/MiniCPM4.1-8B),为研究社区提供了可复现的实现。

关键词

引用

@article{arxiv.2509.24663,
  title  = {InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation},
  author = {Weilin Zhao and Zihan Zhou and Zhou Su and Chaojun Xiao and Yuxuan Li and Yanghao Li and Yudi Zhang and Weilun Zhao and Zhen Li and Yuxiang Huang and Ao Sun and Xu Han and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:2509.24663},
  year   = {2025}
}