用于多模态图像检索的概率组合嵌入
计算机视觉与模式识别
2022-04-13 v1 机器学习
摘要
现有图像检索工作常考虑以一或两种查询输入检索图像,无法推广到多个查询。本文研究图像检索中组合多个多模态查询这一更具挑战性的场景。给定任意数量的查询图像和(或)文本,我们的目标是检索包含多个多模态查询中所指定语义概念的目标图像。为学习可灵活编码各类查询语义的信息化嵌入,我们提出一种新颖的多模态概率组合器(MPC)。具体而言,我们将输入图像与文本建模为概率嵌入,并可通过概率组合规则进一步组合,以助力带多个多模态查询的图像检索。我们基于 MS-COCO 数据集提出新基准,并在组合多图像和(或)文本查询的多种设置下评估我们的模型。无需额外技巧,我们表明概率模型表述在多模态图像检索上显著优于现有相关方法,同时能很好泛化到以任意视觉和(或)文本模态给出的不同数量输入查询。代码见:https://github.com/andreineculai/MPC。
引用
@article{arxiv.2204.05845,
title = {Probabilistic Compositional Embeddings for Multimodal Image Retrieval},
author = {Andrei Neculai and Yanbei Chen and Zeynep Akata},
journal= {arXiv preprint arXiv:2204.05845},
year = {2022}
}
备注
CVPR2022 MULA workshop