GRAPHMOE: 通过引入自反思机制放大混合专家网络的认知深度
计算与语言
2026-01-06 v4 人工智能
摘要
传统的混合专家(Mixture-of-Experts, MoE)网络受益于使用多个较小的专家模型而非单个大型网络。然而,这些专家通常独立运行,留下了一个问题:是否可以通过互连这些模型来增强MoE网络的性能?为此,我们引入GRAPHMOE,这是一种旨在通过构建基于伪图混合专家网络的自反思机制来增强语言模型认知深度的新方法。GRAPHMOE采用循环路由策略来模拟迭代思考步骤,从而促进专家节点之间的信息流动。我们采用低秩适应(Low-Rank Adaptation, LoRA)技术实现GRAPHMOE架构,并在 various benchmark 数据集上进行大量实验。实验结果表明,GRAPHMOE在其他基于LoRA的模型中取得了最先进(SOTA)性能。此外,本研究探索了一种新的循环路由策略,可能为进一步增强语言模型推理能力提供灵感。
引用
@article{arxiv.2501.07890,
title = {GRAPHMOE: Amplifying Cognitive Depth of Mixture-of-Experts Network via Introducing Self-Rethinking Mechanism},
author = {Bo Lv and Chen Tang and Zifan Zheng and Bohao Yang and Kun Zhao and Ning Liao and Xiaoxing Wang and Feiyu Xiong and Zhiyu Li and Nayu Liu and Jingchi Jiang},
journal= {arXiv preprint arXiv:2501.07890},
year = {2026}
}
备注
10 pages