中文

城市场景图像的语义分割

计算机视觉与模式识别 2021-10-27 v1 机器学习

摘要

城市场景图像分割是计算机视觉中一个重要且热门的课题,具有自动驾驶等广泛用例 [1]。从 Long 等人 [2] 引入全卷积网络(FCNs)的突破性工作开始,近 5 年来语义分割中新颖架构的开发与神经网络的实际应用得以加速。除了针对由池化引起的信息收缩的一般模型设计寻求解决方案外,城市场景图像本身具有如位置模式 [3] 等内在特征。我们的项目在当前领域最新方法中寻求一种专门面向城市场景图像语义分割的先进且集成的解决方案。我们以 ResNet-101 [5] 为骨干重新实现了前沿模型 DeepLabv3+ [4] 作为强基线模型。在 DeepLabv3+ 基础上,我们引入 HANet [3] 以考虑城市场景图像任务中的垂直空间先验。为提升模型效率与性能,我们进一步探索 DeepLabv3+ 中的空洞空间池化(ASP)层,并在模型中注入一种称为“瀑布”空洞空间池化(WASP)[6] 的计算高效变体架构。我们发现我们的两步集成模型使平均交并比(mIoU)分数相较基线模型逐步提升。特别地,HANet 成功识别了高度驱动的模式,并提升了城市场景中如栅栏和公交车等常见类标签的逐类 IoU。我们还展示了借助 WASP 在训练计算时间与参数量较原始 ASPP 模块减少方面带来的模型效率提升。

关键词

引用

@article{arxiv.2110.13813,
  title  = {Semantic Segmentation for Urban-Scene Images},
  author = {Shorya Sharma},
  journal= {arXiv preprint arXiv:2110.13813},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2003.05128, arXiv:1912.03183 by other authors