中文

基于双阶段特征级聚类的混合专家框架

机器学习 2025-03-13 v1 人工智能 计算机视觉与模式识别 计算机科学中的逻辑

摘要

混合专家(MoE)模型已在深度学习(DL)中取得成功。然而,其复杂架构以及相对于密集模型在图像分类中的优势仍不清楚。在先前研究中,MoE 性能常受输入空间中噪声和异常值的影响。一些方法将输入聚类纳入 MoE 模型训练,但大多数聚类算法无法访问标注数据,限制了其有效性。本文提出了双阶段特征级聚类与伪标签混合专家(DFCP-MoE)框架,由输入特征提取、特征级聚类和计算高效的伪标签策略组成。该方法减少了噪声和异常值的影响,同时利用少量标注数据为大量无标注输入打上标签。我们提出了一种条件端到端联合训练方法,通过在聚类良好的标注输入上训练 MoE 模型来提升专家特化。与传统 MoE 和密集模型不同,DFCP-MoE 框架有效捕获了输入空间多样性,从而获得了具有竞争力的推理结果。我们在三个多类分类基准数据集上验证了所提出的方法。

关键词

引用

@article{arxiv.2503.09504,
  title  = {Double-Stage Feature-Level Clustering-Based Mixture of Experts Framework},
  author = {Bakary Badjie and José Cecílio and António Casimiro},
  journal= {arXiv preprint arXiv:2503.09504},
  year   = {2025}
}

备注

14 Pages, 1 Figure, and 3 Tables