中文

ORDNet:捕获全范围依赖关系用于场景解析

计算机视觉与模式识别 2021-01-12 v1

摘要

学习捕获空间位置间依赖关系对许多视觉任务至关重要,尤其是像场景解析这样的密集标注问题。现有方法可利用自注意力机制有效捕获长程依赖,并利用局部卷积捕获短程依赖。然而,长程与短程依赖之间仍存在较大鸿沟,这极大降低了模型在复杂自然场景图像中应用于多样空间尺度与关系的灵活性。为填补此鸿沟,我们开发了中程(MR)分支,通过将自注意力限制于局部块来捕获中程依赖。此外,我们观察到与其他区域具有大相关性的空间区域可被强调以更准确地利用长程依赖,从而提出重加权长程(RLR)分支。基于所提 MR 与 RLR 分支,我们构建了全范围依赖网络(ORDNet),可有效捕获短、中、长程依赖。我们的 ORDNet 能提取更全面的上下文信息并良好适应场景图像中的复杂空间变化。大量实验表明,我们所提 ORDNet 在 PASCAL Context、COCO Stuff 和 ADE20K 三个场景解析基准上优于先前最先进方法,展示了在深度模型中捕获全范围依赖用于场景解析任务的优越性。

关键词

引用

@article{arxiv.2101.03929,
  title  = {ORDNet: Capturing Omni-Range Dependencies for Scene Parsing},
  author = {Shaofei Huang and Si Liu and Tianrui Hui and Jizhong Han and Bo Li and Jiashi Feng and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2101.03929},
  year   = {2021}
}

备注

Published at TIP