看见重要之物:赋能CLIP的补丁生成-选择方法
计算机视觉与模式识别
2025-03-24 v1
摘要
CLIP模型通过在大规模图像-文本对上进行预训练,显著 advancement了视觉与语言模态的对齐,使其在various domains上实现强大的零样分类和检索能力。然而,CLIP的训练计算密集,数据处理和内存需求都很高。为此,近期出现了关注性掩码策略,这些策略通过选择性移除图像补丁来提高训练效率。虽然有效,但这些方法常常会损失关键语义信息,导致视觉特征与文本描述之间的对齐次于最佳。在本工作中,我们提出了一种简洁而有效的方法,称为补丁生成-选择(Patch Generation-to-Selection),以保持关键语义内容的同时提高CLIP的训练效率。我们的方法在整个图像上应用Sobel边缘检测生成边缘掩码,以优先保留主要目标区域。最后,计算候选掩码补丁与其相邻补丁之间的相似性得分,并通过optimal transport归一化来细化选择过程,以确保平衡的相似性矩阵。我们的做法CLIP-PGS在零样分类和检索任务中取得了新的state-of-the-art结果,在robustness evaluation和language compositionality基准测试中实现了卓越的性能。
引用
@article{arxiv.2503.17080,
title = {Seeing What Matters: Empowering CLIP with Patch Generation-to-Selection},
author = {Gensheng Pei and Tao Chen and Yujia Wang and Xinhao Cai and Xiangbo Shu and Tianfei Zhou and Yazhou Yao},
journal= {arXiv preprint arXiv:2503.17080},
year = {2025}
}
备注
accepted by CVPR 2025