中文

面向语义分割的动态聚焦感知位置查询

计算机视觉与模式识别 2023-03-29 v3

摘要

类 DETR 的分割器支撑了语义分割领域最近的诸多突破,其端到端地训练一组表示类原型或目标片段的查询。近来,掩码注意力被提出以将每个查询限制为仅关注由前一解码器块预测的前景区域,从而更易优化。尽管前景可期,它依赖于可学习的参数化位置查询,这类查询往往编码数据集统计信息,导致对不同个体查询的定位不准确。本文中,我们提出了一种简单而有效的语义分割查询设计,称为动态聚焦感知位置查询(DFPQ),其基于前一解码器块的交叉注意力分数以及对应图像特征的位置编码,同时动态地生成位置查询。因此,我们的 DFPQ 为目标片段保留了丰富的定位信息,并提供准确且细粒度的位置先验。此外,我们提出通过仅基于低分辨率交叉注意力分数聚合上下文 token 来执行局部关系聚合,从而高效处理高分辨率交叉注意力。在 ADE20K 和 Cityscapes 上的大量实验表明,通过对 Mask2former 的两处修改,我们的框架取得了 SOTA 性能,并分别在 ADE20K 验证集上以 ResNet-50、Swin-T 和 Swin-B 骨干网络超越 Mask2former 单尺度 mIoU 达 1.1%、1.9% 和 1.1% 的明显优势。源代码见 https://github.com/ziplab/FASeg

关键词

引用

@article{arxiv.2204.01244,
  title  = {Dynamic Focus-aware Positional Queries for Semantic Segmentation},
  author = {Haoyu He and Jianfei Cai and Zizheng Pan and Jing Liu and Jing Zhang and Dacheng Tao and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2204.01244},
  year   = {2023}
}

备注

CVPR 2023