LexLIP:用于大规模图文检索的词典瓶颈语言-图像预训练
计算机视觉与模式识别
2023-02-07 v1 信息检索
摘要
图文检索(ITR)是一项在给定另一模态查询的情况下检索相关图像/文本的任务。传统的密集检索范式依赖于使用双流编码器将图像和文本编码为密集表示,然而在大规模检索场景中面临检索速度慢的挑战。在这项工作中,我们提出了词典加权范式,其中为图像和文本学习词汇空间中的稀疏表示,以利用词袋模型和高效的倒排索引,从而显著降低检索延迟。图像数据的连续性与稀疏词汇空间表示的要求之间产生了关键鸿沟。为了弥合这一鸿沟,我们引入了一种新颖的预训练框架,即词典瓶颈语言-图像预训练,以学习重要性感知的词典表示。该框架在双流编码器和弱化文本解码器之间引入了词典瓶颈模块,允许构建连续词袋瓶颈以学习词典重要性分布。在使用同等规模数据进行预训练后,我们的 LexLIP 在两个基准 ITR 数据集 MSCOCO 和 Flickr30k 上实现了最先进的性能。此外,在大规模检索场景中,LexLIP 优于 CLIP,检索速度快 5.5 ~ 221.3 倍,索引存储内存少 13.2 ~ 48.8 倍。
引用
@article{arxiv.2302.02908,
title = {LexLIP: Lexicon-Bottlenecked Language-Image Pre-Training for Large-Scale Image-Text Retrieval},
author = {Ziyang luo and Pu Zhao and Can Xu and Xiubo Geng and Tao Shen and Chongyang Tao and Jing Ma and Qingwen lin and Daxin Jiang},
journal= {arXiv preprint arXiv:2302.02908},
year = {2023}
}