为弱开放词汇语义分割揭示原型知识
计算机视觉与模式识别
2023-10-31 v1 人工智能
机器学习
摘要
本文研究弱开放词汇语义分割(WOVSS)问题,其仅利用图像-文本对来学习分割任意类别的物体。现有工作通过引入显式分组识别来增强原始视觉 transformer,即采用若干组令牌/质心对图像令牌进行聚类并执行组-文本对齐。然而,这些方法在组令牌的使用上存在粒度不一致问题:训练阶段以全对一方式对齐,而推理阶段以一对一方式对齐。我们认为该差异源于缺乏对每组令牌的精细监督。为弥合此粒度鸿沟,本文从原型知识中探索对组令牌的显式监督。为此,本文提出不可学习原型正则化(NPR),其中不可学习原型由源特征估计得出,用作监督并实现组令牌的对比匹配。该正则化促使组令牌以更少冗余分割物体并捕获更全面的语义区域,从而提升紧凑性与丰富性。基于 NPR,我们提出原型引导分割网络(PGSeg),其通过利用来自图像与文本不同层次的双模态原型源,结合多模态正则化,以多样的原型模式逐步增强分割能力。实验结果表明,我们所提方法在多个基准数据集上取得了最先进的性能。源代码见 https://github.com/Ferenas/PGSeg。
引用
@article{arxiv.2310.19001,
title = {Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic Segmentation},
author = {Fei Zhang and Tianfei Zhou and Boyang Li and Hao He and Chaofan Ma and Tianjiao Zhang and Jiangchao Yao and Ya Zhang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2310.19001},
year = {2023}
}
备注
14 pages, Accept in NeurIPS 2023