基于 CLIP 的训练-free 开词汇分割自适应注意力反馈机制
计算机视觉与模式识别
2025-08-29 v1 机器学习
摘要
CLIP 在视觉-文本对齐方面表现出强大能力,但在开词汇分割中因定位不足而受限。先前方法通过修改中间注意力来增强空间一致性,但这种一致性因投影等后续操作而未能稳定传递到最终输出。此外,中间注意力缺乏与文本表示的直接交互,导致语义差异限制了 CLIP 的潜力。本文提出一种训练-free、反馈驱动的自适应框架,将基于输出的 patch 级对应关系反馈至中间注意力。输出预测作为模型处理的终点,包含了每个 patch 最全面的视觉和文本语义。我们通过利用模型输出作为更强的空间一致性先验,增强内部表示与最终预测之间的语义一致性。我们设计了注意力隔离、基于置信度的稀疏适应修剪和适应集成等关键模块,以有效反馈输出一致性线索。该方法作为插件模块可无缝集成到四种最新方法中,并支持三种 backbone(ViT-B、ViT-L、ViT-H)。我们进一步在八个基准测试中验证了该框架,适用于多种注意力类型(Q-K、self-self 和 Proxy 类型,包括 MAE、SAM 和 DINO)。我们的方法在所有基准测试中均一致提升了性能。
引用
@article{arxiv.2508.20265,
title = {Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation},
author = {Zhixiang Chi and Yanan Wu and Li Gu and Huan Liu and Ziqiang Wang and Yang Zhang and Yang Wang and Konstantinos N. Plataniotis},
journal= {arXiv preprint arXiv:2508.20265},
year = {2025}
}
备注
ICCV 2025, code:https://github.com/chi-chi-zx/FSA