MEDOE:一种面向长尾语义分割的多专家解码与输出集成框架
计算机视觉与模式识别
2023-08-17 v1
摘要
语义类别的长尾分布在传统方法中常被忽视,导致在尾部类别上的语义分割性能不佳。本文中,我们关注长尾语义分割问题。尽管其他问题中已提出一些长尾识别方法(如重采样/重加权),但它们可能损害关键的上下文信息,因而难以适配长尾语义分割问题。为解决该问题,我们提出 MEDOE,一种通过上下文信息集成与分组实现长尾语义分割的新框架。所提两阶段框架由多专家解码器(MED)与多专家输出集成(MOE)组成。具体而言,MED 包含若干“专家”。基于像素频率分布,各专家以按特定类别掩码的数据集为输入,自适应生成用于分类的上下文信息;MOE 采用可学习的决策权重对专家输出进行集成。作为模型无关框架,我们的 MEDOE 可灵活高效地耦合多种流行深度神经网络(如 DeepLabv3+、OCRNet 与 PSPNet)以提升其长尾语义分割性能。实验结果表明,所提框架在 Cityscapes 与 ADE20K 数据集上以 mIoU 最高提升 1.78%、mAcc 最高提升 5.89% 优于当前方法。
引用
@article{arxiv.2308.08213,
title = {MEDOE: A Multi-Expert Decoder and Output Ensemble Framework for Long-tailed Semantic Segmentation},
author = {Junao Shen and Long Chen and Kun Kuang and Fei Wu and Tian Feng and Wei Zhang},
journal= {arXiv preprint arXiv:2308.08213},
year = {2023}
}
备注
18 pages, 9 figures