中文

捕获全范围上下文用于全景分割

计算机视觉与模式识别 2021-03-11 v1 机器人学 图像与视频处理

摘要

卷积网络(ConvNets)在语义分割方面表现出色,并已成为自动驾驶感知的关键组件。全景相机提供对街景的全包容视野,在此类系统中显得尤为契合。大多数用于解析城市场景的分割模型作用于常见的窄视野(FoV)图像。将这些为其设计领域而训练的模型迁移至360度感知时,其性能急剧下降,例如在已有测试集上绝对下降30.0%(mIoU)。为弥合成像领域间在FoV与结构分布上的差距,我们引入高效并发注意力网络(ECANets),直接捕获全景图像中固有的长程依赖。除可跨越360度图像学习的基于注意力的上下文先验外,我们通过利用多源与全景监督学习来改进模型训练,同时发挥密集标注与来自多个数据集的未标注数据之长。为推动全景图像分割进展,我们提出并在Wild PAnoramic Semantic Segmentation(WildPASS)上广泛评估模型,该数据集旨在捕获全球各地的多样场景。我们的新颖模型、训练方案与多源预测融合将公开PASS(60.2%)与全新WildPASS(69.0%)基准上的性能(mIoU)提升至新的最优结果。

关键词

引用

@article{arxiv.2103.05687,
  title  = {Capturing Omni-Range Context for Omnidirectional Segmentation},
  author = {Kailun Yang and Jiaming Zhang and Simon Reiß and Xinxin Hu and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2103.05687},
  year   = {2021}
}

备注

Accepted to CVPR2021