中文

IDRNet:用于语义分割的干预驱动关系网络

计算机视觉与模式识别 2023-10-18 v1

摘要

共现视觉模式表明像素关系建模有助于密集预测任务,这催生了众多上下文建模范式,例如多尺度驱动和相似性驱动的上下文方案。尽管取得了令人印象深刻的成果,这些现有范式由于依赖大量预定先验,常受到上下文信息聚合不足或低效的困扰。为缓解这些问题,我们提出一种新颖的干预驱动关系网络(IDRNet),其利用删除诊断过程来指导不同像素间上下文关系的建模。具体而言,我们首先在伪标签引导下将像素级表示分组为语义级表示,并通过特征增强模块进一步提升分组表示的可区分性。接下来,进行删除诊断过程,通过感知网络输出来建模这些语义级表示的关系,并利用提取的关系指导语义级表示相互交互。最后,交互后的表示被用于增强原始像素级表示以进行最终预测。我们进行了大量实验,从定量和定性上验证 IDRNet 的有效性。值得注意的是,我们的干预驱动上下文方案为最先进(SOTA)的分割框架带来了稳定的性能提升,并在流行基准数据集(包括 ADE20K、COCO-Stuff、PASCAL-Context、LIP 和 Cityscapes)上取得了有竞争力的结果。代码见 \url{https://github.com/SegmentationBLWX/sssegmentation}。

关键词

引用

@article{arxiv.2310.10755,
  title  = {IDRNet: Intervention-Driven Relation Network for Semantic Segmentation},
  author = {Zhenchao Jin and Xiaowei Hu and Lingting Zhu and Luchuan Song and Li Yuan and Lequan Yu},
  journal= {arXiv preprint arXiv:2310.10755},
  year   = {2023}
}

备注

Accepted by NeurIPs 2023