中文

基于循环注意力网络的模态特定跨模态相似性度量

计算机视觉与模式识别 2017-08-17 v1 计算与语言 多媒体

摘要

如今,跨模态检索在灵活查找不同模态数据间的信息方面发挥着不可或缺的作用。有效度量不同模态数据间的相似性是跨模态检索的关键。图像与文本等不同模态之间存在不平衡且互补的关系,在描述相同语义时包含不等量的信息。例如,图像通常包含文本描述无法展现的更多细节,反之亦然。基于深度神经网络(DNN)的现有工作大多为不同模态构建一个公共空间以寻找它们之间的潜在对齐,但这会丢失其独有的模态特定特征。与现有工作不同,我们提出了一种模态特定跨模态相似性度量(MCSM)方法,通过为每个模态构建独立的语义空间,采用端到端框架直接生成模态特定的跨模态相似性,而无需显式的公共表示。在每个语义空间中,利用循环注意力网络充分挖掘单一模态内的模态特定特征,同时将另一模态的数据通过基于注意力的联合嵌入投影到该空间中,利用学习到的注意力权重指导细粒度的跨模态相关学习,从而捕捉不同模态间不平衡且互补的关系。最后,通过对模态特定的跨模态相似性进行自适应融合,探索不同模态语义空间之间的互补性,以执行跨模态检索。在广泛使用的 Wikipedia 和 Pascal Sentence 数据集以及我们构建的大规模 XMediaNet 数据集上的实验验证了所提方法的有效性,其性能优于 9 种 state-of-the-art 方法。

关键词

引用

@article{arxiv.1708.04776,
  title  = {Modality-specific Cross-modal Similarity Measurement with Recurrent Attention Network},
  author = {Yuxin Peng and Jinwei Qi and Yuxin Yuan},
  journal= {arXiv preprint arXiv:1708.04776},
  year   = {2017}
}

备注

13 pages, submitted to IEEE Transactions on Image Processing