通过专家异构性提高受污染混合型多项逻辑专家的最小逼近估计速率
统计理论
2026-02-03 v1 机器学习
统计理论
摘要
受污染的混合专家(MoE)模型源于迁移学习方法,其中预训练模型作为冻结专家被集成,适配器模型作为可训练专家,以学习新任务。尽管近期努力旨在分析该模型参数估计的收敛行为,但文献中仍存在两个未解决问题。首先,受污染的MoE模型仅在回归设置中受到研究,而其在分类设置中的理论基础尚未形成。其次,针对分类设置的MoE模型的现有工作仅捕捉参数估计的点态收敛速率,而未提供最小逼近最优性的保证。本文通过对含同质和异质结构的受污染混合型多项逻辑专家进行首次的收敛分析,填补了上述差距。在每个 regime 中,我们 characterize 在地面参数随样本量变化的挑战性设置下,对参数估计的统一收敛速率。此外,我们还建立相应的最小逼近下界,以确保这些速率是最小逼近最优的。值得注意的是,我们的理论提供了关于受污染MoE设计的重要见解,即专家异构性可实现更快的参数估计速率,因此比专家同质性更具样本效率。
引用
@article{arxiv.2602.00939,
title = {Improving Minimax Estimation Rates for Contaminated Mixture of Multinomial Logistic Experts via Expert Heterogeneity},
author = {Fanqi Yan and Dung Le and Trang Pham and Huy Nguyen and Nhat Ho},
journal= {arXiv preprint arXiv:2602.00939},
year = {2026}
}
备注
Fanqi Yan, Dung Le contributed equally to this work. 41 pages, 3 figures, 1 table