面向通用零样本分割的原语生成与语义相关对齐
计算机视觉与模式识别
2023-06-21 v1
摘要
本文研究通用零样本分割,旨在对未见类别实现全景、实例与语义分割而无需任何训练样本。此类零样本分割能力依赖于语义空间中的类间关系,以将已见类别学到的视觉知识迁移至未见类别。因此,期望能良好地桥接语义-视觉空间,并将语义关系应用于视觉特征学习。我们引入一个生成模型来合成未见类别的特征,该模型关联了语义与视觉空间,并解决了缺乏未见训练数据的问题。此外,为缓解语义与视觉空间间的域差距,首先,我们用学习到的原语增强原始生成器,每个原语包含与类别相关的细粒度属性,并通过选择性组装这些原语来合成未见特征。其次,我们提出将视觉特征解耦为语义相关部分与语义无关部分,后者包含有用的视觉分类线索但与语义表示关联较弱。随后要求语义相关视觉特征的类间关系与语义空间中的类间关系对齐,从而将语义知识迁移至视觉特征学习。所提方法在零样本全景分割、实例分割与语义分割上取得了令人印象深刻的SOTA性能。代码见 https://henghuiding.github.io/PADing/。
引用
@article{arxiv.2306.11087,
title = {Primitive Generation and Semantic-related Alignment for Universal Zero-Shot Segmentation},
author = {Shuting He and Henghui Ding and Wei Jiang},
journal= {arXiv preprint arXiv:2306.11087},
year = {2023}
}
备注
CVPR 2023, Project Page: https://henghuiding.github.io/PADing/