CaseNet:用于场景解析的内容自适应尺度交互网络
计算机视觉与模式识别
2020-10-12 v3
摘要
图像中不同空间位置的对象呈现不同尺度。期望自适应感受野能捕获合适的上下文范围以进行准确的像素级语义预测。近来,具有不同膨胀率的空洞卷积已用于通过若干分支生成多尺度特征,随后融合用于预测。然而,不同尺度的分支之间缺乏显式交互以自适应地充分利用上下文。本文中,我们提出一种内容自适应尺度交互网络(CASINet)来利用多尺度特征进行场景解析。我们基于经典的空洞空间金字塔池化(ASPP)模块构建 CASINet,其后接提出的上下文尺度交互(CSI)模块和尺度自适应(SA)模块。具体而言,在 CSI 模块中,对于某一尺度的每个空间位置,我们不再受限于在不同空间位置共享的固定卷积滤波器集合进行特征学习,而是提升卷积滤波器对空间位置的自适应性。我们通过不同尺度特征间的上下文交互实现这一点。SA 模块显式且柔和地为每个空间位置和每个通道选择合适的尺度。消融研究证明了所提模块的有效性。我们在三个场景解析基准 Cityscapes、ADE20K 和 LIP 上取得了最先进的性能。
引用
@article{arxiv.1904.08170,
title = {CaseNet: Content-Adaptive Scale Interaction Networks for Scene Parsing},
author = {Xin Jin and Cuiling Lan and Wenjun Zeng and Zhizheng Zhang and Zhibo Chen},
journal= {arXiv preprint arXiv:1904.08170},
year = {2020}
}
备注
Accepted by Neurocomputing