中文

FarSee-Net:基于高效多尺度上下文聚合与特征空间超分辨率实时语义分割

计算机视觉与模式识别 2020-03-10 v1 机器人学

摘要

实时语义分割在诸多计算资源受限的机器人应用中备受青睐。语义分割的一个挑战在于处理目标尺度变化并利用上下文信息。如何在有限计算预算内实现多尺度上下文聚合十分关键。本文首先引入一种新颖高效的模块,称为级联分解空洞空间金字塔池化(CF-ASPP)。它是一种轻量级级联结构,供卷积神经网络(CNNs)高效利用上下文信息。另一方面,出于运行效率考虑,现有最优方法会在网络早期阶段迅速减小输入或特征图的空间尺寸。最终的高分辨率结果通常通过非参数上采样操作(如双线性插值)获得。不同的是,我们重新思考该流程并将其视为超分辨率过程。我们在上采样步骤中使用优化的超分辨率操作,提升了精度,尤其在实时应用的子采样输入图像场景下。融合上述两点改进,我们的方法相比其他最优方法提供了更好的延迟-精度权衡。特别地,在单块 Nivida Titan X(Maxwell)GPU 卡上,我们在 Cityscapes 测试集以 84 fps 取得 68.4% mIoU。所提模块可插入任意特征提取 CNN 中,并受益于 CNN 结构的发展。

关键词

引用

@article{arxiv.2003.03913,
  title  = {FarSee-Net: Real-Time Semantic Segmentation by Efficient Multi-scale Context Aggregation and Feature Space Super-resolution},
  author = {Zhanpeng Zhang and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2003.03913},
  year   = {2020}
}

备注

Accepted to ICRA 2020