SpikingBrain2.0:面向高效长上下文和跨平台推理的脑类神经网络基础模型
机器学习
2026-04-27 v1
摘要
扩大上下文长度正在重塑大模型开发,但全注意力 Transformer 在长序列上面临计算和推理瓶颈。关键挑战在于设计能够在最小训练开销下保持性能和长上下文效率的基础模型。我们引入了 SpikingBrain2.0(SpB2.0),一个 5B 参数模型,旨在提升其前身的架构和训练效率。我们的贡献有两方面:(1)架构创新:我们提出了 Dual-Space Sparse Attention(DSSA),一种稀疏 Softmax 注意力(MoBA)和稀疏线性注意力(SSE)的跨层混合,实现了更好的性能-效率权衡以适用于长上下文建模。SpB2.0 还支持双重量化路径:INT8 脉冲编码实现稀疏事件驱动计算,FP8 编码加速现代 GPU 的推理。(2)增强的训练策略:我们开发了优化的 Transformer-to-Hybrid(T2H)管道,针对 LLMs 和 VLMs 使用双重转换路径,基于精选开源数据。经验上,SpB2.0-5B 和 SpB2.0-VL-5B 在不超过 7k 个 A100 GPU 小时的情况下几乎恢复了基础 Transformer(Qwen3-4B)的能力。SpB2.0 在 4M 上下文实现 10.13 倍的首次到达时间加速,并支持在 8 个 A100 GPU 上运行超过 10M 标记,超出全注意力模型的内存限制。它还显示出强大的跨平台兼容性,使 FP8 GPU 推理(250k 处 2.52 倍加速)和高效神经形态执行(64.31% 稀疏度,500MHz 时面积和功耗降低 70.6% 和 46.5%)成为可能。总体而言,SpikingBrain2.0 为轻量级、多模态、脑类神经网络基础模型提供了实用路径,凸显了将脑类机制与高效架构结合以满足资源受限和边缘场景潜力。
引用
@article{arxiv.2604.22575,
title = {SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference},
author = {Yuqi Pan and Jinghao Zhuang and Yupeng Feng and Fangzhi Zhong and Siyu Ding and Xuerui Qiu and Shaowei Gu and Bohan Sun and Zhiyong Qin and Yibo Zhong and Lingtao Ouyang and Kun Yang and Zehao Liu and Yuhong Chou and Shurong Wang and Anjie Hu and Han Xu and Bo Xu and Guoqi Li},
journal= {arXiv preprint arXiv:2604.22575},
year = {2026}
}