MoE-SPNet:一种混合专家场景解析网络
计算机视觉与模式识别
2018-06-20 v1
摘要
场景解析是理解场景内语义不可或缺的组成成分。传统方法依赖手工局部特征与概率图模型来融合局部与全局线索。近来,基于全卷积神经网络的方法在场景解析上取得了新纪录。这些方法的一个共同重要策略是由深度卷积神经网络产生的层次化特征的聚合。然而,典型算法通常通过拼接或线性组合来聚合层次化卷积特征,这无法充分利用多尺度特征中上下文信息的多样性以及场景的空间非均匀性。本文提出一种混合专家场景解析网络(MoE-SPNet),其引入卷积混合专家层来评估来自不同层级及不同空间位置特征的重要性。此外,我们提出一种称为自适应层次特征聚合(AHFA)机制的混合专家变体,可嵌入到现有使用跳跃连接逐层融合特征的场景解析网络中。在所提网络中,每个空间位置的不同层级特征在聚合前根据局部结构与周围上下文信息被自适应地重新加权。我们基于 FCN-8s 和 DeepLab-ASPP 两类基线模型,在 PASCAL VOC 2012 和 SceneParse150 两个场景解析数据集上验证了所提方法的有效性。
引用
@article{arxiv.1806.07049,
title = {MoE-SPNet: A Mixture-of-Experts Scene Parsing Network},
author = {Huan Fu and Mingming Gong and Chaohui Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:1806.07049},
year = {2018}
}