中文

基于注意力桥接的Transformer到Mamba数据高效蒸馏

机器学习 2025-10-24 v2

摘要

状态空间模型(SSM)因其递归结构在可扩展性方面优于Transformer,成为序列建模的高效替代方案。然而,其训练成本高昂,生态系统不如Transformer成熟。此外,SSM与Transformer之间的结构异构性限制了从预训练注意力模型高效蒸馏知识。本文提出Cross-architecture distillation via Attention Bridge(CAB),一种新型数据高效蒸馏框架,高效地将Transformer教师的注意力知识传递给状态空间学生模型。不同于传统仅在输出层传递知识的蒸馏方法,CAB通过轻量级桥接实现token级监督,并支持灵活的层级对齐,提升了效率与可迁移性。我们进一步引入灵活的层级对齐策略,适配教师与学生模型间的架构差异。广泛的视觉与语言领域实验表明,本方法在有限训练数据下仍能显著提升状态空间模型性能,超越常规及跨架构蒸馏方法。我们的研究表明,注意力机制的知识可被高效传递至递归模型,促进Transformer专业知识快速转化为强大的SSM社区建设。

关键词

引用

@article{arxiv.2510.19266,
  title  = {Data Efficient Any Transformer-to-Mamba Distillation via Attention Bridge},
  author = {Penghao Wang and Yuhao Zhou and Mengxuan Wu and Panpan Zhang and Zhangyang Wang and Kai Wang},
  journal= {arXiv preprint arXiv:2510.19266},
  year   = {2025}
}