结合分组多头注意力混合专家的动态自适应共享专家模型
机器学习
2025-09-16 v1 人工智能
摘要
基于混合专家架构的 Transformer 模型在长序列建模方面取得了显著进展,但现有模型在计算效率和捕获长距离依赖的能力上仍存在不足,尤其是在专家资源分配的动态适应性方面。在本文中,我们提出了一种动态自适应共享专家与分组多头注意力混合模型(DASG-MoE),通过集成三个模块来增强长序列建模能力。首先,我们采用分组多头注意力(GMHA)机制,以有效降低长序列的计算复杂度。通过序列分组的并行处理、局部滑动窗口注意力和特征聚合,我们解决了长距离依赖问题以及模型对局部信息缺乏泛化能力的问题。其次,我们设计了双尺度共享专家结构(DSSE),其中浅层专家使用轻量级计算快速响应低维特征,而深层专家通过预训练迁移和训练后优化处理高维复杂语义,实现了效率与准确性的动态平衡。第三,我们提出了一种分层自适应动态路由(ADR)机制,该机制根据特征复杂度和任务要求动态选择专家级别,并通过局部专家激活策略优化资源分配。在多个长序列基准数据集上的实验表明,我们的 DASG-MoE 模型优于当前最先进的模型。
关键词
引用
@article{arxiv.2509.10530,
title = {Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts},
author = {Cheng Li and Jiexiong Liu and Yixuan Chen and Jie ji},
journal= {arXiv preprint arXiv:2509.10530},
year = {2025}
}