LightningDOT:用于实时图文检索的视觉-语义嵌入预训练
计算与语言
2021-04-13 v2 计算机视觉与模式识别
摘要
多模态预训练推动了视觉与语言研究的巨大进步。这些大规模预训练模型尽管取得了成功,却由于主要来自Transformer架构中跨模态注意力的巨大计算成本而不可避免地存在推理速度慢的问题。当应用于实际生活场景时,这种延迟和计算需求严重阻碍了预训练模型的实用化。在本文中,我们研究图文检索(ITR)——最成熟的视觉+语言应用形态,其甚至在近期预训练模型出现之前就已被广泛研究。我们提出了一种简单但极其有效的方法LightningDOT,在不牺牲准确率的前提下将ITR的推理时间加速数千倍。LightningDOT通过基于三个新颖学习目标的预训练、离线提取特征索引,以及采用即时点积匹配并进一步重排序,消除了耗时的跨模态注意力,显著加快了检索过程。事实上,LightningDOT在Flickr30k、COCO和Multi30K等多个ITR基准上取得了新的state of the art,优于消耗1000倍计算时长的现有预训练模型。代码与预训练检查点见https://github.com/intersun/LightningDOT。
引用
@article{arxiv.2103.08784,
title = {LightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time Image-Text Retrieval},
author = {Siqi Sun and Yen-Chun Chen and Linjie Li and Shuohang Wang and Yuwei Fang and Jingjing Liu},
journal= {arXiv preprint arXiv:2103.08784},
year = {2021}
}
备注
NAACL 2021