功能成分剔除揭示混合语言模型架构中的专化模式
计算与语言
2026-03-25 v1 人工智能
机器学习
摘要
混合语言模型将注意力机制与状态空间模型(SSMs)或线性注意力相结合,虽然能提高效率,但是否真正充分利用了这两个组件仍不明确。我们提出了一种用于两个亚1B参数混合模型的功能成分剔除框架——通义千模型3.5-0.8B(顺序结构:Gated DeltaNet + softmax注意力)和Falcon-H1-0.5B(并行结构:Mamba-2 + 注意力),并以纯Transformer控制模型(通义千模型2.5-0.5B)为基准。通过分组剔除、层级扫描、位置剔除、匹配随机控制以及在五个基准测试中的困惑度分析,我们确立了四项发现:(1)两种组件类型都至关重要, neither 被绕过;(2)替代组件(线性注意力或SSM)是主要的语言建模骨架,移除时会导致>35,000倍的困惑度恶化,而注意力机制仅约82倍;(3)组件重要性遵循位置梯度,早期层具有显著优势;(4)混合架构相对于纯Transformer在随机层剔除方面具有20-119倍的鲁棒性,揭示了组件类型之间内置的功能冗余。这些结果为混合模型压缩、架构设计和容错部署提供了可操作的指导。
引用
@article{arxiv.2603.22473,
title = {Functional Component Ablation Reveals Specialization Patterns in Hybrid Language Model Architectures},
author = {Hector Borobia and Elies Seguí-Mas and Guillermina Tormo-Carbó},
journal= {arXiv preprint arXiv:2603.22473},
year = {2026}
}
备注
22 pages, 7 figures, 6 tables. Code and data available at https://github.com/hborobia/hybrid-component-ablation