中文

基于相关对齐学习共享语义空间用于跨模态事件检索

信息检索 2019-05-23 v3 计算机视觉与模式识别 多媒体

摘要

在本文中,我们提出利用相关对齐学习共享语义空间(S3CA{S}^{3}CA)以进行多模态数据表示,该方法在为异构数据设计的深度神经网络中对齐多模态数据分布的非线性相关。在跨模态(事件)检索背景下,我们设计了一个带卷积层与全连接层的神经网络来提取图像特征,包括类 Flickr 社交媒体上的图像。同时,我们利用全连接神经网络提取文本的语义特征,包括来自新闻媒体的新闻文章。特别地,在双网络联合训练过程中,两网络中层激活的非线性相关通过相关对齐得以对齐。此外,我们将多模态数据投影至共享语义空间以进行跨模态(事件)检索,其中异构数据样本间的距离可直接度量。另外,我们贡献了一个 Wiki-Flickr 事件数据集,其中多模态数据样本并不像现有配对数据集那样成对相互描述,而是均描述语义事件。在配对与非配对数据集上进行的广泛实验表明了 S3CA{S}^{3}CA 的有效性,其优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.1901.04268,
  title  = {Learning Shared Semantic Space with Correlation Alignment for Cross-modal Event Retrieval},
  author = {Zhenguo Yang and Zehang Lin and Peipei Kang and Jianming Lv and Qing Li and Wenyin Liu},
  journal= {arXiv preprint arXiv:1901.04268},
  year   = {2019}
}

备注

22 pages, submitted to ACM Transactions on Multimedia Computing Communications and Applications(ACM TOMM)