一图胜千言:基于文本与草图的图像检索
计算机视觉与模式识别
2022-08-09 v1 机器学习
摘要
我们解决利用草图和文本查询共同检索图像的问题。我们提出 TASK-former(Text And SKetch transformer,文本与草图 transformer),一种以文本描述和草图作为输入、端到端可训练的图像检索模型。我们认为两种输入模态以单独任一模态难以轻易实现的方式相互补充。TASK-former 遵循类似于 CLIP 的后期融合双编码器方法,由于检索集可独立于查询建立索引,因而允许高效且可扩展的检索。我们通过经验证明,相较于传统基于文本的图像检索,额外使用输入草图(即使是画得不好的草图)可显著提高检索召回率。为评估我们的方法,我们为 COCO 数据集测试集中的图像收集了 5000 个手绘草图。所收集的草图可在 https://janesjanes.github.io/tsbir/ 获取。
引用
@article{arxiv.2208.03354,
title = {A Sketch Is Worth a Thousand Words: Image Retrieval with Text and Sketch},
author = {Patsorn Sangkloy and Wittawat Jitkrittum and Diyi Yang and James Hays},
journal= {arXiv preprint arXiv:2208.03354},
year = {2022}
}
备注
ECCV 2022