中文

基于辅助文本描述的跨模态注意力对齐网络用于零样本素描基图像检索

计算机视觉与模式识别 2024-07-02 v1

摘要

本文研究了零样本素描基图像检索(ZS-SBIR)问题。以往方法在仅包含类别标签甚至无文本信息的双模态设置下解决此问题。然而,大规模预训练语言模型(LLM)的日益普及,这些模型已展示出从 web 规模数据中学习到的丰富知识,为我们提供了从文本中提取集体信息的机会。我们的核心创新在于将文本数据作为图像的辅助信息,从而利用语言所具备的内在零样本泛化能力。为此,我们提出一种方法,称为基于辅助文本描述的跨模态注意力对齐网络,用于零样本素描基图像检索。该网络包含三个组件:(i) 一个描述生成模块,通过对多个疑问句进行提示,为每个训练类别生成文本描述;(ii) 一个特征提取模块,包括两个用于素描和图像数据的 ViT,以及用于提取每个训练类别句子标记的 transformer;(iii) 一个跨模态对齐模块,使用跨注意力机制交换文本-素描和文本-图像的标记特征,并在局部和全局层面对齐标记。在三个基准数据集上的大量实验表明,我们在零样本素描基图像检索方法方面优于最先进的技术。

关键词

引用

@article{arxiv.2407.00979,
  title  = {Cross-Modal Attention Alignment Network with Auxiliary Text Description for zero-shot sketch-based image retrieval},
  author = {Hanwen Su and Ge Song and Kai Huang and Jiyan Wang and Ming Yang},
  journal= {arXiv preprint arXiv:2407.00979},
  year   = {2024}
}