HiVLP:面向快速图文检索的分层视觉-语言预训练
计算机视觉与模式识别
2022-06-01 v2 计算与语言
摘要
过去几年,视觉-语言预训练(VLP)的出现将跨模态检索带入了一个新时代。然而,由于延迟和计算需求,将VLP应用于实时在线检索系统通常具有挑战性。为缓解这一缺陷,本文提出一种用于快速图文检索(ITR)的分层视觉-语言预训练(HiVLP)。具体而言,我们设计了一种新颖的分层检索目标,其使用不同维度的表示进行由粗到细的ITR,即使用低维表示进行大规模粗检索,使用高维表示进行小规模细检索。我们在两个流行的图文检索基准(即Flickr30k和COCO)上评估了所提出的HiVLP。大量实验表明,我们的HiVLP不仅具有快速的推理速度,而且可以轻松扩展到大规模ITR场景。详细结果显示,在不同候选场景下,HiVLP比基于融合的模型UNITER快,比最快的基于嵌入的模型LightingDot快25倍。与最快的基于嵌入的模型LightingDot相比,它在COCO上实现了约+4.9 AR,在Flickr30K上实现了+3.8 AR,并且达到了与当前最优(SOTA)基于融合的模型METER相当的性能。
引用
@article{arxiv.2205.12105,
title = {HiVLP: Hierarchical Vision-Language Pre-Training for Fast Image-Text Retrieval},
author = {Feilong Chen and Xiuyi Chen and Jiaxin Shi and Duzhen Zhang and Jianlong Chang and Qi Tian},
journal= {arXiv preprint arXiv:2205.12105},
year = {2022}
}