中文

基于图卷积网络建模文本的跨模态信息检索

信息检索 2018-02-14 v2

摘要

跨模态信息检索旨在从给定某一模态的查询中查找不同模态的异构数据。主要挑战是将不同模态映射到一个公共语义空间,其中不同模态间概念的距离能够被良好建模。对于图像与文本之间的跨模态信息检索,现有工作大多使用现成的卷积神经网络 (CNN) 进行图像特征提取。对于文本,则采用词袋或 word2vec 等词级特征来构建深度学习模型以表示文本。除词级语义外,词间的语义关系同样蕴含丰富信息但较少被探索。在本文中,我们基于 word2vec 的相似度度量通过图对文本建模。提出了一种双路径神经网络模型用于跨模态信息检索中的耦合特征学习。一条路径利用图卷积网络 (GCN) 基于图表示进行文本建模。另一条路径使用具有非线性层的神经网络基于现成特征进行图像建模。该模型通过成对相似度损失函数进行训练,以最大化相关文本-图像对的相似度并最小化不相关对的相似度。实验结果表明,所提模型显著优于当前最优方法,最佳情况下准确率提升 17%。

关键词

引用

@article{arxiv.1802.00985,
  title  = {Modeling Text with Graph Convolutional Network for Cross-Modal Information Retrieval},
  author = {Jing Yu and Yuhang Lu and Zengchang Qin and Yanbing Liu and Jianlong Tan and Li Guo and Weifeng Zhang},
  journal= {arXiv preprint arXiv:1802.00985},
  year   = {2018}
}

备注

7 pages, 11 figures