MagicLens:基于开放式指令的自监督图像检索
计算机视觉与模式识别
2024-06-26 v2 人工智能
计算与语言
信息检索
多媒体
摘要
图像检索,即在给定参考图像时找到目标图像,本质上包含丰富的、多层面的搜索意图,这些意图很难仅依靠基于图像的度量来捕捉。最近的工作利用文本指令允许用户更自由地表达他们的搜索意图。然而,它们主要关注视觉上相似和/或可以用一小部分预定义关系来表征的图像对。本文的核心论点是,文本指令能够实现检索具有超越视觉相似性的更丰富关系的图像。为了证明这一点,我们引入了 MagicLens,一系列支持开放式指令的自监督图像检索模型。MagicLens 建立在一个关键的新见解之上:在同一网页上自然出现的图像对包含广泛的隐式关系(例如,内部视图),我们可以通过基础模型合成指令将这些隐式关系显式化。在从网络中挖掘的包含丰富语义关系的 36.7M 个(查询图像,指令,目标图像)三元组上进行训练,MagicLens 在各种图像检索任务的八个基准上取得了与先前最佳结果相当或更好的结果,同时以显著更小的模型尺寸保持了高参数效率。在 1.4M 图像的未见语料库上的额外人工分析进一步证明了 MagicLens 支持的搜索意图的多样性。代码和模型公开于 https://open-vision-language.github.io/MagicLens/。
引用
@article{arxiv.2403.19651,
title = {MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions},
author = {Kai Zhang and Yi Luan and Hexiang Hu and Kenton Lee and Siyuan Qiao and Wenhu Chen and Yu Su and Ming-Wei Chang},
journal= {arXiv preprint arXiv:2403.19651},
year = {2024}
}
备注
ICML 2024 (Oral); Project Website: https://open-vision-language.github.io/MagicLens/