基于注意力重新分配的开放词汇语义分割目标聚焦:一个可解释性视角
计算机视觉与模式识别
2025-11-21 v1
摘要
开放词汇语义分割 (OVSS) 采用像素级视觉-语言对齐,将与类别相关的提示与相应像素关联。一个关键挑战是增强多模态密集预测能力,具体而言,就是提高像素级多模态对齐能力。虽然现有方法通过利用 CLIP 的视觉-语言对齐取得了令人满意的结果,但很少从可解释性机制的角度探讨 CLIP 在密集预测中的性能边界。本文系统性地研究了 CLIP 的内部机制,识别出一个关键现象:类似于人类的注意力分散,CLIP 将大量注意力资源从目标区域转向无关标记。我们的分析表明,这些标记源于维度特定的过度激活;过滤它们可提高 CLIP 的密集预测性能。因此,我们提出了重新聚焦 CLIP (RF-CLIP),一种无训练的方法,模拟人类注意力分散-重新聚焦的行为,将注意力从干扰标记重新定向到目标区域,从而细化 CLIP 的多模态对齐粒度。该方法在八个基准测试上实现了 SOTA 性能,同时保持高的推理效率。
引用
@article{arxiv.2511.16170,
title = {Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective},
author = {Jiahao Li and Yang Lu and Yachao Zhang and Yong Xie and Fangyong Wang and Yuan Xie and Yanyun Qu},
journal= {arXiv preprint arXiv:2511.16170},
year = {2025}
}
备注
Accepted by AAAI 2026