中文

基于跨尺度像素到区域关系操作的多尺度特征聚合用于语义分割

计算机视觉与模式识别 2022-06-28 v2

摘要

利用多尺度特征在处理语义分割问题方面已展现出巨大潜力。聚合通常通过求和或拼接(concat)后接卷积(conv)层来完成。然而,这种方式将高层上下文完全向下传递至后续层级,而未考虑它们之间的相互关系。在本工作中,我们旨在通过一种跨尺度像素到区域关系操作,使低层特征能够聚合来自相邻高层特征图的互补上下文。我们利用跨尺度上下文传播,使得即便高分辨率低层特征也能捕获长程依赖。为此,我们采用高效的特征金字塔网络来获取多尺度特征。我们提出了关系语义提取器(RSE)和关系语义传播器(RSP),分别用于上下文提取与传播。随后我们将多个RSP堆叠为RSP头,以实现上下文的渐进式自顶向下分布。在两个具有挑战性的数据集Cityscapes和COCO上的实验结果表明,RSP头在语义分割与全景分割任务上均以高效率取得了具有竞争力的性能。在语义分割任务中,它以少75%的FLOPs(乘加运算)比DeeplabV3 [1]高出0.7%。

关键词

引用

@article{arxiv.2106.01744,
  title  = {Multi-Scale Feature Aggregation by Cross-Scale Pixel-to-Region Relation Operation for Semantic Segmentation},
  author = {Yechao Bai and Ziyuan Huang and Lyuyu Shen and Hongliang Guo and Marcelo H. Ang and Daniela Rus},
  journal= {arXiv preprint arXiv:2106.01744},
  year   = {2022}
}

备注

Accepted to RA-L 2021. in IEEE Robotics and Automation Letters. The contents of this paper were also selected by the 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2021) Program Committee for presentation at the Conference