中文

专精与融合:面向语义分割的金字塔输出表征

计算机视觉与模式识别 2021-08-20 v2

摘要

我们提出了一种新颖的金字塔输出表征,以通过我们的“专精与融合”过程确保语义分割的简洁性。金字塔“输出”表征由粗到细的层级组成,其中每个层级“专精”于不同的类别分布(例如,较粗层级中 stuff 类多于 things 类)。两类金字塔输出(即统一金字塔与语义金字塔)被“融合”为最终语义输出,其中统一金字塔指示统一单元(即该单元内所有像素共享同一语义标签)。该过程通过为统一单元预测相对较少的标签(例如一大片草的单元)来构建最终语义输出,从而确保简洁性。除“输出”表征外,我们设计了一个由粗到细的上下文模块,以聚合来自不同层级的“特征”表征。我们通过全面的消融研究验证了方法中每个关键模块的有效性。最后,我们的方法在三个广泛使用的语义分割数据集——ADE20K、COCO-Stuff 和 Pascal-Context 上取得了最先进的性能。

关键词

引用

@article{arxiv.2108.01866,
  title  = {Specialize and Fuse: Pyramidal Output Representation for Semantic Segmentation},
  author = {Chi-Wei Hsiao and Cheng Sun and Hwann-Tzong Chen and Min Sun},
  journal= {arXiv preprint arXiv:2108.01866},
  year   = {2021}
}

备注

Update presentation