中文

零样本全场景草图图像检索及其可解释实现

计算机视觉与模式识别 2023-03-28 v1

摘要

本文研究零样本草图图像检索(ZS-SBIR)问题,但与以往工作有两个显著区别:(i)我们仅用单一网络处理 ZS-SBIR 的所有变体(类间、类内及跨数据集),即“全场景”(everything);(ii)我们迫切希望理解这种草图-照片匹配是如何运作的,即“可解释”。我们的关键创新在于认识到此类跨模态匹配问题可化简为若干关键局部块组的比较——类似于成熟的“词袋”范式。仅此改变,我们便同时实现了上述两个目标,且额外免除了对外部语义知识的需求。技术上,我们的是一个基于 transformer 的跨模态网络,包含三个新颖组件:(i)带可学习分词器的自注意力模块,以生成对应于最具信息量局部区域的视觉词元;(ii)跨注意力模块,用于计算两模态间视觉词元的局部对应关系;以及(iii)基于核的关系网络,用于汇集局部假定匹配并生成草图-照片对的整体相似度度量。实验表明,我们的方法确实在所有 ZS-SBIR 设定下均取得了更优性能。最为重要的可解释目标通过可视化跨模态词元对应关系优雅实现,并首次通过用所有匹配照片块通用替换来合成草图到照片的图像得以展现。代码与模型见 \url{https://github.com/buptLinfy/ZSE-SBIR}。

关键词

引用

@article{arxiv.2303.14348,
  title  = {Zero-Shot Everything Sketch-Based Image Retrieval, and in Explainable Style},
  author = {Fengyin Lin and Mingkang Li and Da Li and Timothy Hospedales and Yi-Zhe Song and Yonggang Qi},
  journal= {arXiv preprint arXiv:2303.14348},
  year   = {2023}
}

备注

CVPR 2023 (Highlight)