面向零样本指代图像分割的图像编辑模型早期语义 grounding
计算机视觉与模式识别
2026-05-14 v1
摘要
指令式图像编辑 (IIE) 模型最近在根据自然语言指令修改特定图像区域方面展现出强大的能力,这隐含地要求其识别编辑应如何应用,从而表明这些模型本质上执行的是语言条件的视觉语义 grounding。本文我们探讨了这种隐式 grounding 是否可被利用用于零样本指代图像分割 (RIS),这是一项需要像素级定位由自然语言表达式描述的对象的任务。通过系统性分析,我们揭示这些模型在最早的去噪时刻就呈现出强大的前景-背景可分离性,远在任何可见图像转换发生之前。基于这一洞察,我们提出一种无训练框架,通过利用预训练图像编辑模型的中间表示来 repurposing 用于 RIS。该方法将 localization 分解为两个互补组成部分:基于注意力的空间先验估计关注位置,以及基于特征的语义判别确定要分割的内容。通过利用特征空间的可分离性,该框架仅需一个去噪步骤即可生成准确的分割掩码,且无需完整图像合成。广泛的 RefCOCO、RefCOCO+ 和 RefCOCOg 实验表明,方法在现有零样本基线上实现了优异性能。
关键词
引用
@article{arxiv.2605.13122,
title = {Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation},
author = {Jingxuan He and Xiyu Wang and Yunke Wang and Mengyu Zheng and Chang Xu},
journal= {arXiv preprint arXiv:2605.13122},
year = {2026}
}