中文

TransMamba:面向序列级别的Transformer-Mamba混合语言模型

机器学习 2026-01-08 v2

摘要

变换器是现代大型语言模型的基石,但其二次计算复杂度限制了在长序列处理中的效率。近期出现的Mamba——一种具有线性复杂度的时态空间模型(SSM)——提供了可期望的效率提升,但因上下文学习不稳定和多任务泛化不足而受到限制。一些工作开展了层级混合结构,将Transformer与Mamba层组合,以充分利用两者优势。本文提出TransMamba,一种新型序列级别混合框架,通过共享参数矩阵(QKV 与 CBx)实现Transformer与Mamba的统一,从而能够在不同token长度和层级之间动态切换注意力机制与时态空间模型。我们设计了Memory Converter,通过将注意力输出转换为时态空间模型兼容的状态,确保在信息流动的TransPoint处实现无缝转换。TransPoint调度也被彻底探索,以平衡有效性与效率。我们进行了大量实验,表明TransMamba在训练效率和性能上均优于单一模型和混合基线,验证了Transformer与Mamba范式在序列级别的深层一致性,为下一代语言建模提供了可扩展的解决方案。代码和数据已在 https://github.com/Yixing-Li/TransMamba 提供。

关键词

引用

@article{arxiv.2503.24067,
  title  = {TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model},
  author = {Yixing Li and Ruobing Xie and Zhen Yang and Xingwu Sun and Shuaipeng Li and Weidong Han and Zhanhui Kang and Yu Cheng and Chengzhong Xu and Di Wang and Jie Jiang},
  journal= {arXiv preprint arXiv:2503.24067},
  year   = {2026}
}

备注

Accepted by AAAI 2026. Code: https://github.com/Yixing-Li/TransMamba