中文

VIP:面向高效密集视觉-语言推理的视觉引导提示演化

计算机视觉与模式识别 2026-05-14 v2

摘要

由于CLIP中根深蒂固的空间偏差,以高效且可泛化的方式追求免训练的开词汇语义分割仍然具有挑战性。为克服现有解决方案的局限性,本工作超越了基于CLIP的范式,利用近期具有空间感知能力的dino..txt框架来促进更高效和高质量的密集预测。虽然dino..txt展现出强大的空间感知能力,但我们发现文本查询的语义模糊性导致其密集跨模态交互中出现严重的不匹配。为解决此问题,我们引入了视觉引导提示演化(VIP)来纠正dino..txt中文本查询的语义表达能力,释放其在细粒度目标感知方面的潜力。为此,VIP将别名扩展与视觉引导蒸馏机制相结合,以挖掘有价值的语义线索,并以显著性感知的方式稳健地聚合这些线索,从而产生高保真度的预测。大量评估表明,VIP:1. 平均mIoU超过顶尖方法1.4%-8.4%,2. 能很好地泛化到各种具有挑战性的领域,3. 仅需极少的推理时间和内存开销。

关键词

引用

@article{arxiv.2605.12325,
  title  = {VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference},
  author = {Hao Zhu and Shuo Jin and Wenbin Liao and Jiayu Xiao and Yan Zhu and Siyue Yu and Feng Dai},
  journal= {arXiv preprint arXiv:2605.12325},
  year   = {2026}
}

备注

Accepted by ICML2026. Code is available at https://github.com/MiSsU-HH/VIP