通过未掩码令牌对齐增强视觉-语言模型
计算机视觉与模式识别
2024-06-17 v2
摘要
以CLIP为代表的图像-文本对对比预训练已成为学习多模态视觉-语言表示的标准技术。尽管CLIP表现出色,但在嘈杂的网络规模数据集上从头训练它计算量巨大。另一方面,像掩码图像建模(MIM)这样的掩码-预测预训练方法为单模态表示提供了高效的自监督学习。本文介绍了未掩码令牌对齐(UTA),一种利用现有CLIP模型进一步增强其视觉-语言表示的方法。UTA通过将未掩码的视觉令牌与来自冻结CLIP视觉编码器的相应图像令牌对齐来训练视觉Transformer(ViT),这自动将ViT模型与CLIP文本编码器对齐。预训练的ViT可以直接用于零样本评估,即使没有在图像-文本对上进行训练。与MIM方法相比,UTA不存在训练-微调不一致的问题,并且通过避免使用额外的[MASK]令牌而更加训练高效。大量实验结果表明,UTA可以增强CLIP模型,并在各种单模态和多模态基准测试上优于现有的MIM方法。代码和模型可在https://github.com/jihaonew/UTA获取。
引用
@article{arxiv.2405.19009,
title = {Enhancing Vision-Language Model with Unmasked Token Alignment},
author = {Jihao Liu and Jinliang Zheng and Boxiao Liu and Yu Liu and Hongsheng Li},
journal= {arXiv preprint arXiv:2405.19009},
year = {2024}
}
备注
Accepted by TMLR; Code and models are available at https://github.com/jihaonew/UTA