中文

MAR:基于模块感知架构细化的高效大语言模型

人工智能 2026-04-23 v1 计算与语言 机器学习 神经与进化计算

摘要

大语言模型在众多领域表现卓越,但因二次注意力与稠密前馈网络(FFN)运算而面临高能耗。为此,我们提出模块感知架构细化(MAR)框架,集成状态空间模型(SSM)实现线性时间序列建模,并对激活函数进行稀疏化以降低 FFN 成本。此外,为缓解融合脉冲神经网络(SNN)与 SSM 时序不匹配与信息密度低的问题,我们设计自适应三值多步神经元(ATMN)与脉冲感知双向蒸馏策略(SBDS)。大量实验表明,MAR 在受限资源下能复现其稠密模型的性能,同时大幅降低推理能耗。且该方法在规模相当甚至更大的高效模型中均表现出优势,凸显其构建高效实用大语言模型的潜力。

关键词

引用

@article{arxiv.2601.21503,
  title  = {MAR: Efficient Large Language Models via Module-aware Architecture Refinement},
  author = {Junhong Cai and Guiqin Wang and Kejie Zhao and Jianxiong Tang and Xiang Wang and Luziwei Leng and Ran Cheng and Yuxin Ma and Qinghai Guo},
  journal= {arXiv preprint arXiv:2601.21503},
  year   = {2026}
}

备注

Accepted by ICASSP 2026. 5 pages, 5 figures