面向图像检索的图像-文本查询组合学习
计算机视觉与模式识别
2021-06-02 v3 信息检索
摘要
本文研究基于多模态(图像-文本)查询从数据库中检索图像的问题。具体而言,查询文本提示对查询图像进行某些修改,任务是检索具有所需修改的图像。例如,某电子商务平台的用户想购买一件连衣裙,它应类似于其朋友的连衣裙,但应为白色并带有缎带腰饰。在此情况下,我们希望算法能检索出在查询连衣裙上具有所需修改的一些连衣裙。我们提出一种基于自编码器的模型 ComposeAE,以学习图像与文本查询的组合用于图像检索。我们采用深度度量学习方法,学习一种度量,使源图像与文本查询的组合更接近目标图像。我们还提出了优化问题上的旋转对称性约束。我们的方法能够在三个基准数据集(即 MIT-States、Fashion200k 和 Fashion IQ)上优于当前最优方法 TIRG \cite{TIRG}。为确保公平比较,我们通过增强 TIRG 方法引入了强基线。为确保结果可复现,我们在此发布代码:\url{https://github.com/ecom-research/ComposeAE}。
引用
@article{arxiv.2006.11149,
title = {Compositional Learning of Image-Text Query for Image Retrieval},
author = {Muhammad Umer Anwaar and Egor Labintcev and Martin Kleinsteuber},
journal= {arXiv preprint arXiv:2006.11149},
year = {2021}
}
备注
Published at IEEE WACV 2021