面向图像检索的多模态查询嵌入算术
计算机视觉与模式识别
2022-10-21 v2 计算与语言
摘要
潜在文本表示展现出几何规律性,例如著名的类比:女王之于国王犹如女人之于男人。此类结构化语义关系尚未在图像表示上得到证明。近期旨在弥合该语义鸿沟的工作将图像与文本嵌入至多模态空间,从而能够将文本定义的变换迁移至图像模态。我们引入SIMAT数据集以评估多模态查询图像检索任务。SIMAT包含6k图像与18k文本变换查询,旨在替换场景元素或改变场景元素间的两两关系。目标是检索与(源图像, 文本变换)查询一致的图像。我们使用图像/文本匹配预言机(OSCAR)来评估图像变换是否成功。SIMAT数据集将公开可用。我们用SIMAT评估以图像/文本匹配为目标训练的多模态嵌入空间(如CLIP)的几何性质。我们表明原始CLIP嵌入并不十分适合用差分向量变换图像,但在COCO数据集上的简单微调可带来显著改进。我们还研究了利用预训练通用句子编码器(FastText、LASER与LaBSE)是否有益。
引用
@article{arxiv.2112.03162,
title = {Embedding Arithmetic of Multimodal Queries for Image Retrieval},
author = {Guillaume Couairon and Matthieu Cord and Matthijs Douze and Holger Schwenk},
journal= {arXiv preprint arXiv:2112.03162},
year = {2022}
}
备注
accepted at O-DRUM (CVPR workshop 2022)