MossNet: 状态空间专家混合是多头注意力
计算与语言
2025-10-31 v1
摘要
大型语言模型 (LLM) 在自然语言处理 (NLP) 中的生成应用方面取得了显著进展。最近的模型架构趋势围绕高效变换器变体或状态空间/门控循环模型 (SSMs, GRMs)。然而, 现有的 SSM/GRM 方法常仅模拟单个注意力头, 可能限制其表达能力。在本工作中, 我们提出了 MossNet, 一种新型状态空间专家混合架构, 用于模拟线性多头注意力 (MHA)。MossNet 利用在通道混合多层感知机 (MLP) 块中以及时间混合 SSM 核中均采用专家混合 (MoE) 实现多个"注意力头"。在语言建模和下游评估上的大量实验表明, MossNet 在相似模型规模和数据预算的变换器和 SSM 架构基础上 outperform。更大的 MossNet 变体在数千亿标记上训练, 进一步确认了其可扩展性和优异性能。此外, 在三星 Galaxy S24 Ultra 和英伟达 A100 GPU 上进行的实际设备剖析显示, 与同等规模的基线相比, MossNet 在运行速度和资源使用方面表现出 favorable。我们的结果表明, MossNet 是一种具有竞争力的高效高性能循环 LLM 架构的有力新方向。
引用
@article{arxiv.2510.26182,
title = {MossNet: Mixture of State-Space Experts is a Multi-Head Attention},
author = {Shikhar Tuli and James Seale Smith and Haris Jeelani and Chi-Heng Lin and Abhishek Patel and Vasili Ramanishka and Yen-Chang Hsu and Hongxia Jin},
journal= {arXiv preprint arXiv:2510.26182},
year = {2025}
}