中文

动态专家搜索:在测试时增强混合专家大语言模型的推理能力

人工智能 2025-09-29 v1 计算与语言 机器学习

摘要

测试时缩放(Test-Time Scaling, TTS)通过在推理期间分配额外计算来增强大型语言模型(LLMs)的推理能力。然而,现有方法主要依赖于输出级采样,而忽略了模型架构的作用。在主流的混合专家(Mixture-of-Experts, MoE)LLMs 中,我们观察到改变激活专家的数量会产生具有稳定准确率的互补解集,揭示了一种新的且尚未充分探索的多样性来源。受此观察启发,我们提出了动态专家搜索(Dynamic Experts Search, DES),一种将专家激活提升为搜索空间可控维度的 TTS 策略。DES 集成了两个关键组件:(1)Dynamic MoE,允许在推理期间直接控制专家数量,以无额外成本生成多样化的推理轨迹;(2)Expert Configuration Inheritance,在推理路径内保持一致的专家数量,而在多次运行间改变专家数量,从而在搜索过程中平衡稳定性与多样性。跨 MoE 架构、验证器和推理基准(即数学、代码和知识)的大量实验表明,DES 可靠地优于 TTS 基线,在无额外成本的情况下提升了准确率和稳定性。这些结果突出了 DES 作为一种实用且可扩展的架构感知 TTS 形式,展示了现代 LLMs 的结构灵活性如何推进推理。

关键词

引用

@article{arxiv.2509.22572,
  title  = {Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time},
  author = {Yixuan Han and Fan Ma and Ruijie Quan and Yi Yang},
  journal= {arXiv preprint arXiv:2509.22572},
  year   = {2025}
}