中文

稀疏混合专家层在基于 CNN 的语义分割中的设计与行为

计算机视觉与模式识别 2026-04-16 v1 机器学习

摘要

稀疏混合专家(MoE)层已被证明可在计算成本几乎不增高的情况下大幅提升模型容量,广泛应用于 Transformer 架构中,通常取代前馈网络模块。相比之下,将稀疏 MoE 层集成到卷积神经网络(CNN)中仍不一致,大多数先前工作聚焦于在滤波器或通道级别上进行细粒度 MoE。本文我们针对语义分割,探索一种较粗略的 patch 级稀疏 MoE 层的方案,即局部区域被路由到小型卷积专家子集。通过在 Cityscapes 和 BDD100K 数据集上使用编码器-解码器和 backbone 结构的 CNN 进行实验,我们进行设计分析以评估架构选择如何影响路由动力学与专家专化。我们的结果表明,虽然存在强烈的设计敏感性,但各类 CNN 架构下均实现了一致且可观的改进(最高达 +3.9 mIoU),且计算开销较小。我们的工作为 CNN 基于密集预测中的稀疏 MoE 层的设计与内部动力学提供了实证见解。我们的代码已公开于 https://github.com/KASTEL-MobilityLab/moe-layers/。

关键词

引用

@article{arxiv.2604.13761,
  title  = {Design and Behavior of Sparse Mixture-of-Experts Layers in CNN-based Semantic Segmentation},
  author = {Svetlana Pavlitska and Haixi Fan and Konstantin Ditschuneit and J. Marius Zöllner},
  journal= {arXiv preprint arXiv:2604.13761},
  year   = {2026}
}

备注

Accepted for publication at the SAIAD workshop at CVPR 2026