中文

使用 Transformer 编码器的细粒度视觉-文本对齐用于跨模态检索

计算机视觉与模式识别 2021-03-03 v2

摘要

尽管基于深度学习的视觉-文本处理系统不断演进,精确的多模态匹配仍是一项具有挑战性的任务。在这项工作中,我们基于词-区域对齐,仅在全局图像-句子层面使用监督,通过图像-句子匹配来解决跨模态检索任务。具体而言,我们提出了一种称为 Transformer 编码器推理与对齐网络(TERAN)的新方法。TERAN 强制图像和句子的底层组件(即图像区域和词)之间进行细粒度匹配,以保留两种模态的信息丰富性。TERAN 在 MS-COCO 和 Flickr30k 数据集上的图像检索任务中取得了最先进的结果。此外,在 MS-COCO 上,它在句子检索任务上也优于当前的方法。着眼于可扩展的跨模态信息检索,TERAN 被设计为保持视觉和文本数据流水线良好分离。交叉注意力链接会使大规模检索系统中在线搜索和离线索引步骤所需的视觉与文本特征的分别提取变得不可能。在这方面,TERAN 仅在最终对齐阶段、损失计算之前立即合并两个域的信息。我们认为,TERAN 产生的细粒度对齐为研究有效且高效的大规模跨模态信息检索方法铺平了道路。我们将我们方法的有效性与相关最先进方法进行比较。在 MS-COCO 1K 测试集上,我们在 Recall@1 指标上分别取得图像和句子检索任务 5.7% 和 3.5% 的提升。用于实验的代码已在 GitHub 上公开:https://github.com/mesnico/TERAN。

关键词

引用

@article{arxiv.2008.05231,
  title  = {Fine-grained Visual Textual Alignment for Cross-Modal Retrieval using Transformer Encoders},
  author = {Nicola Messina and Giuseppe Amato and Andrea Esuli and Fabrizio Falchi and Claudio Gennaro and Stéphane Marchand-Maillet},
  journal= {arXiv preprint arXiv:2008.05231},
  year   = {2021}
}

备注

Accepted in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM). arXiv admin note: text overlap with arXiv:2004.09144