Hecto:用于自适应和可解释推理的模块化稀疏专家
人工智能
2025-07-02 v2
摘要
Mixture-of-Experts (MoE) 模型通过将输入路由到专用专家来实现条件计算,但这些专家依赖相同的归纳偏置,从而限制了表示多样性。这种静态计算路径对需要不同类型推理的输入效率低下,并限制了专业化和可解释性。我们提出Hecto,一个轻量级MoE架构,通过结合用于时序推理的GRU专家和用于静态抽象的FFNN专家,利用稀疏Top-1门控机制实现架构异构性。在三个推理基准测试(AG News、SST-2、HotpotQA)和一个回归任务(STS-B)上评估的Hecto尽管接收隔离的输入表示,却在性能上与均匀基线相当或接近,同时实现了清晰的专家专业化,每个专家都与不同的推理类型(时序 vs 静态)对齐。在较大的批量大小下,Hecto表现出更好的性能,得益于放宽的计算约束使其异构架构能够更有效地优化。消融结果将Hecto的稳定性和可解释性归因于架构多样性。总体而言,Hecto确立了条件计算的新基准,提供了一个原则化的框架,用于在资源受限的环境中实现专业化推理,其模型性能源于原则化的专业化。
引用
@article{arxiv.2506.22919,
title = {Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning},
author = {Sanskar Pandey and Ruhaan Chopra and Saad Murtaza Bhat and Ark Abhyudaya},
journal= {arXiv preprint arXiv:2506.22919},
year = {2025}
}