中文

注意力掩码 CLIP

计算机视觉与模式识别 2023-10-10 v2 图像与视频处理

摘要

图像 token 移除是一种高效的增强策略,用于降低计算图像特征的成本。然而,这一高效增强策略被发现会对基于 CLIP 的训练精度产生不利影响。我们假设,移除大部分图像 token 可能不当地丢弃了与给定文本描述相关的语义内容,从而在 CLIP 训练中构成不正确的配对目标。为解决此问题,我们提出一种用于 CLIP 训练的注意力 token 移除方法,其保留与文本描述具有高度语义相关性的 token。相关性分数通过使用视觉编码器的 EMA 版本以在线方式计算。我们的实验表明,所提出的注意力掩码方法优于先前的随机 token 移除方法。该方法还能高效地对图像施加多种增强视图,并将这些视图间的实例对比学习任务引入 CLIP 框架。相较于结合 SLIP 和 MaskCLIP 等不同预训练目标的其他 CLIP 改进方法,我们的方法不仅更有效,而且更高效。具体而言,使用 ViT-B 与 YFCC-15M 数据集,我们的方法在 ImageNet-1K 零样本分类上达到 43.9%43.9\% top-1 精度,在 Flickr30K 与 MS COCO 上分别达到 62.7/42.162.7/42.138.0/23.238.0/23.2 的 I2T/T2I 检索精度,较 SLIP 方法分别高出 +1.1%+1.1\%+5.5/+0.9+5.5/+0.9+4.4/+1.3+4.4/+1.3,同时快 2.30×2.30\times。我们方法的一个高效版本比普通 CLIP 模型快 1.16×1.16\times,在这些基准上取得了 +5.3%+5.3\%+11.3/+8.0+11.3/+8.0+9.5/+4.9+9.5/+4.9 的显著提升。

关键词

引用

@article{arxiv.2212.08653,
  title  = {Attentive Mask CLIP},
  author = {Yifan Yang and Weiquan Huang and Yixuan Wei and Houwen Peng and Xinyang Jiang and Huiqiang Jiang and Fangyun Wei and Yin Wang and Han Hu and Lili Qiu and Yuqing Yang},
  journal= {arXiv preprint arXiv:2212.08653},
  year   = {2023}
}