中文

面向细粒度基于草图的图像检索的跨模态融合蒸馏

计算机视觉与模式识别 2022-10-20 v1 机器学习

摘要

基于草图的图像检索的表示学习大多通过丢弃模态特定信息来学习嵌入。由于来自不同模态的实例常能提供描述底层概念的互补信息,我们提出了一种用于 Vision Transformers 的跨注意力框架(XModalViT),其融合而非丢弃模态特定信息。我们的框架首先将来自独立照片与草图模态的成对数据点映射到融合表示,以统一来自两种模态的信息。随后,我们通过对比与关系跨模态知识蒸馏,将上述模态融合网络的输入空间解耦为各独立模态的编码器。此类编码器可应用于跨模态检索等下游任务。我们通过开展广泛实验并在三个细粒度基于草图的图像检索基准 Shoe-V2、Chair-V2 和 Sketchy 上取得最先进(state-of-the-art)结果,证明了所学表示的表达能力。实现代码见 https://github.com/abhrac/xmodal-vit。

关键词

引用

@article{arxiv.2210.10486,
  title  = {Cross-Modal Fusion Distillation for Fine-Grained Sketch-Based Image Retrieval},
  author = {Abhra Chaudhuri and Massimiliano Mancini and Yanbei Chen and Zeynep Akata and Anjan Dutta},
  journal= {arXiv preprint arXiv:2210.10486},
  year   = {2022}
}

备注

British Machine Vision Conference (BMVC) 2022