基于双阶段特征级聚类的混合专家框架
机器学习
2025-03-13 v1 人工智能
计算机视觉与模式识别
计算机科学中的逻辑
摘要
混合专家(MoE)模型已在深度学习(DL)中取得成功。然而,其复杂架构以及相对于密集模型在图像分类中的优势仍不清楚。在先前研究中,MoE 性能常受输入空间中噪声和异常值的影响。一些方法将输入聚类纳入 MoE 模型训练,但大多数聚类算法无法访问标注数据,限制了其有效性。本文提出了双阶段特征级聚类与伪标签混合专家(DFCP-MoE)框架,由输入特征提取、特征级聚类和计算高效的伪标签策略组成。该方法减少了噪声和异常值的影响,同时利用少量标注数据为大量无标注输入打上标签。我们提出了一种条件端到端联合训练方法,通过在聚类良好的标注输入上训练 MoE 模型来提升专家特化。与传统 MoE 和密集模型不同,DFCP-MoE 框架有效捕获了输入空间多样性,从而获得了具有竞争力的推理结果。我们在三个多类分类基准数据集上验证了所提出的方法。
引用
@article{arxiv.2503.09504,
title = {Double-Stage Feature-Level Clustering-Based Mixture of Experts Framework},
author = {Bakary Badjie and José Cecílio and António Casimiro},
journal= {arXiv preprint arXiv:2503.09504},
year = {2025}
}
备注
14 Pages, 1 Figure, and 3 Tables