文本增强空间感知的零样本指代表达图像分割
计算机视觉与模式识别
2023-10-30 v1
摘要
本文研究一项具有挑战性的任务:零样本指代表达图像分割。该任务旨在无需在像素级标注上训练的情况下,识别出与指代表达最相关的实例掩码。先前研究利用预训练跨模态模型(如 CLIP)将实例级掩码与指代表达对齐。然而,CLIP 仅考虑图像-文本对的全局级对齐,忽略了指代表达与局部图像区域之间的细粒度匹配。为应对此挑战,我们引入一种文本增强空间感知(TAS)的零样本指代表达图像分割框架,该框架无需训练且对各类视觉编码器具有鲁棒性。TAS 包含用于实例级掩码提取的掩码提议网络、用于挖掘图像-文本相关性的文本增强视觉-文本匹配分数,以及用于掩码后处理的空间校正器。值得注意的是,文本增强视觉-文本匹配分数除典型视觉-文本匹配分数外,还利用了 P 分数与 N 分数。P 分数通过代理描述生成模型缩小视觉-文本域差距,该分数在代理模型生成文本与指代表达之间计算。N 分数通过负短语挖掘考虑区域-文本对的细粒度对齐,促使被掩码图像远离所挖掘的干扰短语。我们在 RefCOCO、RefCOCO+ 和 RefCOCOg 等多个数据集上进行了充分实验。所提方法明显优于当前最先进的零样本指代表达图像分割方法。
引用
@article{arxiv.2310.18049,
title = {Text Augmented Spatial-aware Zero-shot Referring Image Segmentation},
author = {Yucheng Suo and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2310.18049},
year = {2023}
}
备注
Findings of EMNLP2023