中文

视觉-语言预训练中的过滤、蒸馏与难负样本

计算机视觉与模式识别 2023-03-31 v2

摘要

在大规模含噪数据上以对比学习训练的视觉-语言模型正日益流行于零样本识别问题。本文改进了对比预训练流程的以下三个方面:数据集噪声、模型初始化与训练目标。首先,我们提出一种名为复杂性、动作与文本检测(CAT)的直观过滤策略,其在显著缩减数据集规模的同时,于零样本视觉-语言任务上取得更优性能。接着,我们提出名为概念蒸馏的方法,利用强单模态表征进行对比训练,在不增加训练复杂度的同时优于先前工作。最后,我们修改传统对比对齐目标,并提出一种重要性采样方法,在不增加额外复杂度的情况下提升难负样本的重要性。在包含 29 个任务的广泛零样本基准上,我们的蒸馏与难负训练(DiHT)方法在 20 个任务上优于基线。此外,对于少样本线性探测,我们提出一种缩小零样本与少样本性能差距的新方法,大幅超越先前工作。模型见 https://github.com/facebookresearch/diht。

关键词

引用

@article{arxiv.2301.02280,
  title  = {Filtering, Distillation, and Hard Negatives for Vision-Language Pre-Training},
  author = {Filip Radenovic and Abhimanyu Dubey and Abhishek Kadian and Todor Mihaylov and Simon Vandenhende and Yash Patel and Yi Wen and Vignesh Ramanathan and Dhruv Mahajan},
  journal= {arXiv preprint arXiv:2301.02280},
  year   = {2023}
}

备注

CVPR 2023