中文

OVeNet:用于语义分割的偏移向量网络

计算机视觉与模式识别 2023-11-16 v2 人工智能 机器学习 机器人学

摘要

语义分割是视觉场景理解中的一项基础任务。我们关注有监督设定,即存在真实语义标注。基于真实世界场景具有高规律性的认识,我们提出一种通过学会有选择地利用邻域像素信息来改进类别预测的方法。具体而言,我们的方法基于如下先验:对每个像素,其邻近邻域内存在一个与之共享相同预测的种子像素。受该先验启发,我们设计了一种新颖的双头网络,称为偏移向量网络(Offset Vector Network, OVeNet),它同时生成标准语义预测和一个稠密二维偏移向量场,该向量场指示从每个像素到相应种子像素的偏移,并用于计算一种替代的、基于种子的语义预测。这两种预测通过学到的针对预测偏移向量场的稠密置信度图在每个像素处自适应融合。我们通过优化基于种子的预测以及一种针对置信度图的新损失来间接监督偏移向量。与作为其基础的基线最先进架构 HRNet 和 HRNet+OCR 相比,OVeNet 在三个著名的语义分割基准——Cityscapes、ACDC 和 ADE20K 上取得了显著的性能提升。代码见 https://github.com/stamatisalex/OVeNet

关键词

引用

@article{arxiv.2303.14516,
  title  = {OVeNet: Offset Vector Network for Semantic Segmentation},
  author = {Stamatis Alexandropoulos and Christos Sakaridis and Petros Maragos},
  journal= {arXiv preprint arXiv:2303.14516},
  year   = {2023}
}

备注

Accepted at WACV 2024