中文

用于CNN可解释性的稀疏门控专家混合层

计算机视觉与模式识别 2023-04-28 v3 机器学习

摘要

稀疏门控专家混合(MoE)层近来已成功应用于扩展大型transformer,尤其是语言建模任务。稀疏MoE层一个引人注目的副作用是,它们通过自然的专家专门化给模型带来了内在的可解释性。在本工作中,我们将稀疏MoE层应用于计算机视觉任务中的CNN,并分析其对模型可解释性的影响。为稳定MoE训练,我们提出了基于软约束和硬约束的方法。在硬约束下,某些专家的权重可被允许变为零,而软约束通过额外的辅助损失平衡专家的贡献。结果表明,软约束更好地处理专家利用率并支持专家专门化过程,而硬约束保持更通用的专家并提升整体模型性能。我们的发现表明专家可以隐式地聚焦于输入空间的个别子域。例如,为CIFAR-100图像分类训练的专家专门化于识别花朵或动物等不同域,而无需事先的数据聚类。使用RetinaNet和COCO数据集的实验进一步表明,目标检测专家也可以专门化于检测不同大小的物体。

关键词

引用

@article{arxiv.2204.10598,
  title  = {Sparsely-gated Mixture-of-Expert Layers for CNN Interpretability},
  author = {Svetlana Pavlitska and Christian Hubschneider and Lukas Struppek and J. Marius Zöllner},
  journal= {arXiv preprint arXiv:2204.10598},
  year   = {2023}
}

备注

Accepted for publication at IJCNN 2023