中文

专家混合架构缓解算子学习中的维度灾难

机器学习 2025-12-03 v2 人工智能 数值分析 数值分析 机器学习

摘要

我们研究了专家混合架构在算子学习中的逼近论意义,其中单个大型神经算子的复杂性被分布到许多小型神经算子(NOs)上,并且每个输入通过决策树被路由到恰好一个 NO。我们分析了这种基于树的路由和专家分解如何影响逼近能力、样本复杂性和稳定性。我们的主要结果是神经算子混合体(MoNOs)的分布式通用逼近定理:任何 L2([0,1]d)L^2([0,1]^d) 空间之间的 Lipschitz 非线性算子都可以在 Sobolev 单位球上被一个 MoNO 以任意精度 ε>0\varepsilon>0 一致逼近,其中每个专家 NO 的深度、宽度和秩的缩放比例为 O(ε1)\mathcal{O}(\varepsilon^{-1})。尽管专家的数量可能随精度增长,但每个 NO 保持较小,足以在合理的精度水平下装入标准硬件的活动内存中。我们的分析还为经典 NO 在 L2([0,1]d)L^2([0,1]^d) 的紧子集上一致逼近一致连续非线性算子提供了新的定量逼近速率。

关键词

引用

@article{arxiv.2404.09101,
  title  = {Mixture of Experts Softens the Curse of Dimensionality in Operator Learning},
  author = {Anastasis Kratsios and Takashi Furuya and Jose Antonio Lara Benitez and Matti Lassas and Maarten de Hoop},
  journal= {arXiv preprint arXiv:2404.09101},
  year   = {2025}
}