中文

为您的视觉语言模型再引入一次注意力

计算机视觉与模式识别 2025-07-29 v2

摘要

预训练视觉语言模型(VLM),如 CLIP,虽在零样本任务上取得显著成绩,但其下游潜能依赖于有效的微调。大多数适应方法通常专注于从独立模态(文本或视觉)中细化表征,却忽视了其融合表征在决策过程中发挥的关键作用,即驱动最终预测的有理矩阵。为弥合这一差距,我们提出了一种简单且有效的 \textbf{R}ational \textbf{A}daption ({RAda}),显式地利用最终融合表征进行微调。RAda 采用来自附着于 VLM 末端的轻量级注意力层获取的学习掩码,动态校准有理矩阵中每个元素的贡献,使我们能够在不对中间特征进行高成本修改的情况下,针对性地调整最终的跨模态相互作用。在不同设置(即更新或冻结预训练编码器进行适应,以及只能访问无标签测试数据的测试时适应)中的实验表明,RAda 作为一种通用的微调技术,能够以最小代码量提升基线性能,并在大多数设置下与当前方法持平。代码已在 \href{https://github.com/khufia/RAda/tree/main}{github.com/khufia/RAda} 上提供。

关键词

引用

@article{arxiv.2507.15480,
  title  = {One Last Attention for Your Vision-Language Model},
  author = {Liang Chen and Ghazi Shazan Ahmad and Tianjun Yao and Lingqiao Liu and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2507.15480},
  year   = {2025}
}

备注

Accepted by ICCV 2025