专家-尾部不确定:面向细粒度混合专家的测试时扩展
机器学习
2026-05-04 v2
摘要
测试时扩展通过生成多个备选解决方案来提高 LLM 性能,但基于 token 的抽样需要温度调控,在多样性与稳定性之间进行权衡。细粒度混合专家(Fine-grained MoE)拥有数百个经过训练的专家 per layer 和每个 token 多专家激活,提供了一种未被充分探索的替代方案,其丰富的路由空间。我们经验性地描绘了细粒度 MoE 路由,发现路由得分呈现特定的头部(高置信度专家)和不确定的尾部(低置信度候选者)模式。虽然更少激活专家时单次运行的贪心准确率保持稳定,但多采样 pass@n 显著下降——这表明特定头部支配核心推理能力,而不确定的尾部与推理多样性相关。基于这些发现,我们提出了 Expert-Sample,这是一种无需训练的方法,在保持高置信度选择的同时注入可控随机性到不确定的尾部,从而实现 diverse generation 而不稳定输出。我们在多个细粒度 MoE 模型上评估了该方法,涵盖数学、知识推理和代码任务,Expert-Sample 在 pass@n 和基于验证的准确率上 consistently 提升。在评估 Qwen3-30B-A3B-Instruct 在 GPQA-Diamond 上的 32 个平行样本时,pass@32 从 85.4% 提升至 91.9%,准确率从 59.1% 提升至 62.6%。
引用
@article{arxiv.2602.02443,
title = {Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE},
author = {Yuanteng Chen and Peisong Wang and Nanxin Zeng and Yuantian Shao and Shuang Qiu and Gang Li and Jing Liu and Jian Cheng},
journal= {arXiv preprint arXiv:2602.02443},
year = {2026}
}
备注
25 pages, 13 figures