基于 Transformer 编码器深度特征的高效跨模态视觉文本检索探索
计算机视觉与模式识别
2021-06-02 v1
摘要
跨模态检索是现代搜索引擎中的一项重要功能,因为它允许用户查询与检索对象属于不同模态,从而提升用户体验。本文聚焦于图像-句子检索任务,其目标是为给定句子高效找到相关图像(图像检索)或为给定图像找到相关句子(句子检索)。计算机视觉文献报道,在图像-句子匹配任务上,采用注意力与自注意力机制的深度神经网络取得了最佳结果。它们通过对整个数据集进行顺序扫描来评估检索任务上的匹配性能。该方法在图像或描述文本数量增长时扩展性较差。本工作中,我们从最先进的图像-文本匹配深度学习架构中提取稀疏化深度多模态特征,探索不同的预处理技术。我们的主要目标是为复杂多模态描述的高效索引奠定基础。我们使用近期提出的 TERN 架构作为图像-句子特征提取器。该架构旨在生成描述整幅图像与整句句子的固定长度 1024 维向量,以及分别描述两种模态各组成成分(图像区域与句子单词)的变长 1024 维向量集合。TERN 的设计强制所有这些向量位于同一公共空间中。我们的实验在所探索的方法上展示了有趣的初步结果,并建议在这一重要研究方向开展进一步实验。
引用
@article{arxiv.2106.00358,
title = {Towards Efficient Cross-Modal Visual Textual Retrieval using Transformer-Encoder Deep Features},
author = {Nicola Messina and Giuseppe Amato and Fabrizio Falchi and Claudio Gennaro and Stéphane Marchand-Maillet},
journal= {arXiv preprint arXiv:2106.00358},
year = {2021}
}
备注
Accepted at CBMI 2021