COTS:用于跨模态检索的协作式双流视觉-语言预训练模型
计算机视觉与模式识别
2022-05-23 v2 计算与语言
信息检索
摘要
大规模单流预训练在图像-文本检索中已展现出卓越性能。遗憾的是,由于沉重的注意力层,其面临较低的推理效率。近来,如CLIP和ALIGN等具有高推理效率的双流方法也展现出良好性能,然而它们仅考虑两流之间的实例级对齐(因此仍有改进空间)。为克服这些局限,我们提出了一种新颖的协作式双流视觉-语言预训练模型COTS,用于图像-文本检索,通过增强跨模态交互实现。除通过动量对比学习进行实例级对齐外,我们在COTS中利用了另外两个层次的跨模态交互:(1)令牌级交互——在不使用跨流网络模块的情况下设计了一个掩码视觉-语言建模(MVLM)学习目标,其中在视觉编码器上施加变分自编码器以为每张图像生成视觉令牌。(2)任务级交互——在文本到图像和图像到文本检索任务之间设计了一个KL对齐学习目标,其中每个任务的概率分布由动量对比学习中的负队列计算。在公平比较设置下,我们的COTS在所有双流方法中取得最高性能,并与最新单流方法性能相当(但推理速度快10,800倍)。重要的是,我们的COTS也适用于文本到视频检索,在广泛使用的MSR-VTT数据集上取得了新的最优结果。
引用
@article{arxiv.2204.07441,
title = {COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal Retrieval},
author = {Haoyu Lu and Nanyi Fei and Yuqi Huo and Yizhao Gao and Zhiwu Lu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2204.07441},
year = {2022}
}
备注
Accepted by CVPR2022