中文

基于图模式损失的多样化注意力网络用于跨模态检索

计算机视觉与模式识别 2021-06-28 v1 人工智能

摘要

跨模态检索旨在通过结合图像、视频、文本与音频等多媒体数据来实现灵活的检索体验。无监督方法的核心之一是在无需昂贵标签的情况下挖掘不同对象表示之间的相关性以完成令人满意的检索性能。本文提出一种基于图模式损失的多样化注意力网络(GPLDAN)用于无监督跨模态检索,以深度分析表示间的相关性。首先,我们通过考虑不同表示之间的交互提出一种多样化注意力特征投影器,以生成实例的多种表示。随后,我们设计一种新颖的图模式损失来探索不同表示间的相关性,在该图中考虑了不同表示之间所有可能的距离。此外,在融合前加入一个模态分类器以显式声明特征的对应模态,并引导网络增强判别能力。我们在四个公开数据集上测试了 GPLDAN。与最先进的跨模态检索方法相比,实验结果证明了 GPLDAN 的性能与竞争力。

关键词

引用

@article{arxiv.2106.13552,
  title  = {Graph Pattern Loss based Diversified Attention Network for Cross-Modal Retrieval},
  author = {Xueying Chen and Rong Zhang and Yibing Zhan},
  journal= {arXiv preprint arXiv:2106.13552},
  year   = {2021}
}

备注

5 pages, 3 figures