基于注意力桥接的Transformer到Mamba数据高效蒸馏
机器学习
2025-10-24 v2
摘要
状态空间模型(SSM)因其递归结构在可扩展性方面优于Transformer,成为序列建模的高效替代方案。然而,其训练成本高昂,生态系统不如Transformer成熟。此外,SSM与Transformer之间的结构异构性限制了从预训练注意力模型高效蒸馏知识。本文提出Cross-architecture distillation via Attention Bridge(CAB),一种新型数据高效蒸馏框架,高效地将Transformer教师的注意力知识传递给状态空间学生模型。不同于传统仅在输出层传递知识的蒸馏方法,CAB通过轻量级桥接实现token级监督,并支持灵活的层级对齐,提升了效率与可迁移性。我们进一步引入灵活的层级对齐策略,适配教师与学生模型间的架构差异。广泛的视觉与语言领域实验表明,本方法在有限训练数据下仍能显著提升状态空间模型性能,超越常规及跨架构蒸馏方法。我们的研究表明,注意力机制的知识可被高效传递至递归模型,促进Transformer专业知识快速转化为强大的SSM社区建设。
关键词
引用
@article{arxiv.2510.19266,
title = {Data Efficient Any Transformer-to-Mamba Distillation via Attention Bridge},
author = {Penghao Wang and Yuhao Zhou and Mengxuan Wu and Panpan Zhang and Zhangyang Wang and Kai Wang},
journal= {arXiv preprint arXiv:2510.19266},
year = {2025}
}