面向语义无关且具形状感知的视觉-语言分割模型
计算机视觉与模式识别
2026-05-28 v1
摘要
视觉-语言分割模型最近通过利用自然语言表达的高级语义对象类别实现了强大的性能。然而,这种语义依赖性限制了其推理关于形状、几何或纹理等内在视觉属性的能力,而这些属性是许多实际应用中必不可少的。在本工作中,我们引入语义无关且具形状感知(SANSA)分割,这是一种新范式,需要分割模型仅从非语义文本描述中进行操作。为此,我们提出两种策略来生成基于字典约束或示例引导的 SANSA 分割提示,两者都生成语义无关的文本描述。然后,这些提示用于在语义无关监督下进行分割模型的微调。实验表明,针对 SANSA 提示进行微调可在该新分割任务上实现最高可达 20% 的 mIoU 提升,同时保持对标准语义提示的强性能。这一结果凸显了低层和中层视觉推理对提高视觉-语言分割模型泛化性和可控性的重要性。
引用
@article{arxiv.2605.28348,
title = {Toward Semantic-Agnostic and Shape-Aware Vision-Language Segmentation Models},
author = {Corentin Seutin and Mohamed Amine Ettaki and Michaël Clément and Pierrick Coupé and Rémi Giraud},
journal= {arXiv preprint arXiv:2605.28348},
year = {2026}
}
备注
Accepted at the 2026 IEEE International Conference on Image Processing (ICIP 2026)