中文

Transformer 架构中基于深度特化混合专家的动态推理链

计算与语言 2025-09-26 v1 人工智能 信息检索

摘要

当前的 Transformer 架构对所有输入应用相同的处理深度,造成效率低下并限制推理质量。简单的事实查询与复杂的逻辑问题承受相同的多层计算,浪费资源同时制约深度推理。为克服这一问题,我们提出了深度特化混合专家(DS-MoE)动态推理链的概念,这是一个将混合专家范式从基于宽度扩展到基于深度特化计算的模块化框架。DS-MoE 引入了针对不同推理深度优化的专家模块,包括浅层模式识别、组合推理、逻辑推理、记忆整合和元认知监督。一个学习到的路由网络动态组装自定义推理链,仅激活匹配输入复杂度的必要专家。我们训练和评估 DS-MoE 的数据集是 The Pile,一个覆盖科学论文、法律文本、编程代码和网络内容等多样领域的 800GB 语料库,使得能够系统性地评估不同推理深度。实验结果表明,DS-MoE 相比均匀深度 Transformer 实现了高达 16% 的计算节省和 35% 的推理加速,同时在复杂多步推理基准上实现了 2.8% 的准确率提升。此外,路由决策产生了可解释的推理链,增强了透明度和可扩展性。这些发现确立了 DS-MoE 作为自适应神经网络架构的重要进展,表明深度特化的模块化处理可以同时提升大规模语言模型的效率、推理质量和可解释性。

关键词

引用

@article{arxiv.2509.20577,
  title  = {Dynamic Reasoning Chains through Depth-Specialized Mixture-of-Experts in Transformer Architectures},
  author = {Sampurna Roy and Ayan Sar and Anurag Kaushish and Kanav Gupta and Tanupriya Choudhury and Abhijit Kumar},
  journal= {arXiv preprint arXiv:2509.20577},
  year   = {2025}
}

备注

Submitted in IEEE International Conference on Big Data 2025