超越窗口:用于训练自由开放词汇语义分割的全局-局部对齐 CLIP
计算机视觉与模式识别
2026-03-25 v1 人工智能
摘要
最近的训练自由开放词汇语义分割方法通常采用滑动窗口推理策略,以克服 CLIP 处理高分辨率图像的限制。然而,这种方法引入了新挑战:每个窗口独立处理,导致窗口间出现语义差异。为此,我们提出 Global-Local Aligned CLIP (GLA-CLIP),一个促进跨窗口全面信息交换的框架。我们不将注意力限制于单个窗口内的 token,而是将 key-value token扩展到包含来自所有窗口的上下文线索。然而,我们观察到存在窗口偏置:由于查询特征通过窗口内部 patch 之间的相互作用产生,因此外部窗口的 token 被概率性地忽略,缺乏其超出局部语境的语义 grounding。为缓解这一问题,我们引入代理锚点,通过聚合来自所有窗口中与给定查询高度相似的 token,为衡量内外窗口 patch 之间的相似性提供统一的语义参考。此外,我们提出一种动态归一化方案,根据物体尺度动态调整注意力强度,通过动态缩放和阈值处理注意力图来应对小目标场景。此外,GLA-CLIP 可部署在现有方法之上并扩大其感受野。大量实验验证了 GLA-CLIP 在提升训练自由开放词汇语义分割性能方面的有效性。代码已公开于 https://github.com/2btlFe/GLA-CLIP。
引用
@article{arxiv.2603.23030,
title = {Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation},
author = {ByeongCheol Lee and Hyun Seok Seong and Sangeek Hyun and Gilhan Park and WonJun Moon and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2603.23030},
year = {2026}
}
备注
18 pages, 13 figures, 12 tables, Accepted to CVPR 2026