StacMR:场景文本感知的跨模态检索
计算机视觉与模式识别
2020-12-09 v1
摘要
近期的跨模态检索模型受益于对视觉场景日益丰富的理解,例如场景图与物体交互等。这使得图像视觉表示与其描述文本表示之间的匹配得到改进。然而,当前的视觉表示忽略了一个关键方面:图像中出现的文本,其可能包含对检索至关重要的信息。本文中,我们首先提出一个新数据集,用于探索图像含有场景文本实例时的跨模态检索。随后,借助该数据集,我们描述了若干利用场景文本的方法,包括一种更好的场景文本感知跨模态检索方法,其使用专门表示来处理来自描述文本与来自视觉场景的文本,并在公共嵌入空间中使之协调。大量实验证实跨模态检索方法受益于场景文本,并凸显了值得进一步探索的有趣研究问题。数据集与代码见 http://europe.naverlabs.com/stacmr
引用
@article{arxiv.2012.04329,
title = {StacMR: Scene-Text Aware Cross-Modal Retrieval},
author = {Andrés Mafla and Rafael Sampaio de Rezende and Lluís Gómez and Diane Larlus and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2012.04329},
year = {2020}
}