未对齐、对比然后蒸馏:重新思考语言-图像预训练中的未对齐问题
计算机视觉与模式识别
2023-12-21 v1
摘要
对比语言-图像预训练已成为利用网络上未经筛选的图像-文本对训练视觉和文本编码器的重要方法。为了提高数据效率,最近的工作引入了涉及图像随机增强视图的额外监督项。然而,由于图像增强过程不知道其对应的文本,该过程可能会在训练期间导致不同程度的图像-文本未对齐。先前的方法要么忽略了这种差异,要么引入外部模型来减轻未对齐在训练期间的影响。相比之下,我们提出了一种新颖的度量学习方法,利用这些未对齐作为额外的训练源,我们称之为“未对齐、对比然后蒸馏(MCD)”。以前的方法将增强图像及其对应的文本视为简单的正对,而 MCD 则预测由增强引起的连续未对齐尺度。我们广泛的实验结果表明,我们提出的 MCD 在多个分类和检索下游数据集中实现了最先进的迁移能力。
关键词
引用
@article{arxiv.2312.12661,
title = {Misalign, Contrast then Distill: Rethinking Misalignments in Language-Image Pretraining},
author = {Bumsoo Kim and Yeonsik Jo and Jinhyung Kim and Seung Hwan Kim},
journal= {arXiv preprint arXiv:2312.12661},
year = {2023}
}
备注
ICCV 2023