基于上下文聚合网络的实时语义分割
计算机视觉与模式识别
2021-04-13 v2 机器人学
摘要
随着自主系统需求的增长,用于视觉场景理解的逐像素语义分割不仅需要准确,还需高效以满足潜在的实时应用。本文提出上下文聚合网络(Context Aggregation Network),一种双分支卷积神经网络,与当前最优方法相比计算成本显著降低,同时保持了具竞争力的预测精度。在现有用于高速语义分割的双分支架构基础上,我们设计了一个低成本高分辨率分支以有效刻画空间细节,以及一个包含轻量级全局聚合与局部分布块的上下文分支,能够以低计算开销捕获准确语义分割所需的远程与局部上下文依赖。我们在两个语义分割数据集即 Cityscapes 数据集与 UAVid 数据集上评估了我们的方法。对于 Cityscapes 测试集,我们的模型以在 NVIDIA RTX 2080Ti 上 76 FPS、在 Jetson Xavier NX 上 8 FPS 的速度取得 mIOU 为 75.9% 的当前最优结果。在 UAVid 数据集上,我们所提网络以高执行速度(15 FPS)取得 63.5% 的 mIOU 分数。
引用
@article{arxiv.2011.00993,
title = {Real-time Semantic Segmentation with Context Aggregation Network},
author = {Michael Ying Yang and Saumya Kumaar and Ye Lyu and Francesco Nex},
journal= {arXiv preprint arXiv:2011.00993},
year = {2021}
}
备注
extended version of v1