中文

ResCLIP: 用于训练-free 密集视觉-语言推断的残差注意力

计算机视觉与模式识别 2024-11-26 v1

摘要

虽然视觉-语言模型如 CLIP 在开放词汇任务中显示出卓越的成功,但其应用目前仅限于图像级任务,仍在密集预测方面存在挑战。近期研究往往认为密集预测不足归因于最终块中的自注意力层,已通过修改原始查询-键注意力为自相关注意力(例如查询-查询和键-键注意力)来取得优异结果。然而,这些方法忽略了跨相关注意力(查询-键)的特性,这些特性捕捉了丰富的空间对应关系。本文揭示了 CLIP 非最终层的自注意力中的跨相关也具有局部化特性。因此,我们提出了残差跨相关自注意力 (RCS) 模块,该模块利用中间层的跨相关自注意力来重构最终块中的注意力。RCS 模块有效地重新组织了空间信息,释放了 CLIP 在密集视觉-语言推断中潜在的局部分析能力。此外,为增强对相同类别区域的关注和局部分析一致性,我们提出了语义反馈细化 (SFR) 模块,利用语义分割图进一步调整注意力得分。通过整合这两种策略,我们的方法称为 ResCLIP,可以轻松集成到现有方法中作为即插即用模块,显著提升其在密集视觉-语言推断中的性能。广泛的实验表明,我们的方法在多个标准基准测试上超越了最新的训练-free 方法,验证了所提出方法的有效性。代码已公开 https://github.com/yvhangyang/ResCLIP。

关键词

引用

@article{arxiv.2411.15851,
  title  = {ResCLIP: Residual Attention for Training-free Dense Vision-language Inference},
  author = {Yuhang Yang and Jinhong Deng and Wen Li and Lixin Duan},
  journal= {arXiv preprint arXiv:2411.15851},
  year   = {2024}
}