中文

面向混合专家Transformer的泛化性与尺度律

计算与语言 2026-05-21 v2

摘要

我们发展了混合专家(MoE)Transformer泛化性与尺度律的理论,清晰地分离了输入级的"活跃"容量与路由组合。通过对固定路由模式进行条件化并进行Union Bound,我们导出sup范数覆盖数下界,其度量熵随活跃参数预算而扩展,并产生特定于MoE的路由开销。结合平凡的ERM分析用于平方损失,这导致在d维流形数据模型和C^β目标下得到泛化下界,显示在适当考虑活跃参数后,近似与估计之间的trade-off与稠密网络相同。进一步我们证明了MoE架构的构造性近似定理,表明在近似构造下,误差可通过扩大活跃容量或增加专家数量来降低,取决于主导瓶颈。基于这些结果,我们推导了模型规模、数据规模和计算最优tradeoff的神经尺度律。总体而言,我们的结果为MoE尺度推理提供了透明的统计参考基准,阐明了哪些行为由最坏情况理论保证,哪些则来自数据依赖路由结构或优化动力学。

关键词

引用

@article{arxiv.2604.09174,
  title  = {Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG},
  author = {Passant Elchafei and Monorama Swain and Shahed Masoudian and Markus Schedl},
  journal= {arXiv preprint arXiv:2604.09174},
  year   = {2026}
}