中文

VisualSparta:一种基于加权词袋的大规模文本到图像检索的极简方法

计算机视觉与模式识别 2021-05-24 v2 计算与语言 机器学习

摘要

文本到图像检索是跨模态信息检索中的一项基本任务,即给定文本查询从大规模无标注数据集中检索相关图像。本文提出 VisualSparta,一种新颖的(视觉-文本稀疏 Transformer 匹配)模型,在准确率和效率方面均有显著提升。VisualSparta 能够在 MSCOCO 和 Flickr30K 上超越此前最先进的可扩展方法。我们还表明其具有显著的检索速度优势,即对于 100 万图像索引,使用 CPU 的 VisualSparta 相比 CPU 向量搜索获得约 391 倍加速,相比 GPU 加速向量搜索获得约 5.4 倍加速。实验表明,该速度优势在更大数据集上更为明显,因为 VisualSparta 可高效实现为倒排索引。据我们所知,VisualSparta 是首个基于 Transformer 的文本到图像检索模型,能够对大规模数据集实现实时搜索,且相比此前最先进方法准确率显著提升。

关键词

引用

@article{arxiv.2101.00265,
  title  = {VisualSparta: An Embarrassingly Simple Approach to Large-scale Text-to-Image Search with Weighted Bag-of-words},
  author = {Xiaopeng Lu and Tiancheng Zhao and Kyusong Lee},
  journal= {arXiv preprint arXiv:2101.00265},
  year   = {2021}
}

备注

Accepted to ACL2021 (10 pages)