理解与增强Mamba-Transformer混合模型在记忆召回与语言建模中的表现
计算与语言
2025-11-03 v1
摘要
将状态空间模型(SSM)与注意力机制相结合的混合模型通过利用SSM的效率和注意力的高召回能力显示出强大的性能。然而,这些混合模型背后的架构设计选择仍不充分理解。在本工作中,我们通过记忆利用和整体性能的视角分析混合架构,并提出一种互补方法来进一步增强其效果。我们首先检查SSM和注意力层的顺序与并行集成之间的区别。我们的分析揭示了若干有趣的发现,包括顺序混合模型在较短的上下文上表现更好,而并行混合模型在较长的上下文中更有效。我们还引入了一种数据中心方法,通过持续训练在增强了语义重复项的数据集上进行训练,从而在保持其他能力的同时进一步增强召回能力。该方法在不同基础模型之间具有良好的概括性,并优于旨在增强召回能力的架构修改。我们的发现提供了对混合SSM注意力模型的更深入理解,并为针对各种用例设计定制化架构提供了实用指导。我们的发现提供了对混合SSM注意力模型的更深入理解,并为针对各种用例设计定制化架构提供了实用指导。
引用
@article{arxiv.2510.26912,
title = {Understanding and Enhancing Mamba-Transformer Hybrids for Memory Recall and Language Modeling},
author = {Hyunji Lee and Wenhao Yu and Hongming Zhang and Kaixin Ma and Jiyeon Kim and Dong Yu and Minjoon Seo},
journal= {arXiv preprint arXiv:2510.26912},
year = {2025}
}