检索与分割:仅凭几例示例是否足以弥合开放词汇分割中的监督差距?
计算机视觉与模式识别
2026-02-27 v1
摘要
开放词汇分割(OVS)将视觉语言模型(VLM)的零样本识别能力扩展到像素级预测,使其能够对由文本提示指定的任意类别进行分割。尽管近期取得了进展,但OVS仍滞后于完全监督方法,主要due to两个挑战:用于训练VLM的粗糙图像级监督,以及自然语言的语义歧义。我们通过引入少数样本设置来解决这些限制,该设置以像素标注图像的支持集增强文本提示。基于此,我们提出了一种检索增强的测试时适配器,通过融合文本和视觉支持特征来学习每个图像的轻量级分类器。与依赖晚期人工设计融合的先前方法不同,我们的方法采用学习式的、针对每个查询的融合,实现了模态间的更强协同。该方法支持不断扩大的支持集,并可应用于个人化分割等细粒度任务。实验表明,我们显著缩小了零样本与监督分割之间的差距,同时保持了开放词汇能力。
引用
@article{arxiv.2602.23339,
title = {Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?},
author = {Tilemachos Aravanis and Vladan Stojnić and Bill Psomas and Nikos Komodakis and Giorgos Tolias},
journal= {arXiv preprint arXiv:2602.23339},
year = {2026}
}