中文

用于多语言多模态表示学习的桥接相关神经网络

计算与语言 2016-07-04 v3

摘要

近来,学习数据多视图的公共表示备受关注。通常,此类公共表示是利用两个视图之间的平行语料库学习的(例如,100万张图像及其英文描述)。本工作中,我们处理一种真实场景:感兴趣的两个视图(例如 V1V_1V2V_2)之间无直接平行数据,但这两个视图各自与一个枢纽视图(V3V_3)之间均有平行数据。我们提出一种模型,仅使用 V1V3V_1V_3V2V3V_2V_3 之间可用的平行数据,来学习 V1V_1V2V_2V3V_3 的公共表示。所提模型具有通用性,甚至当有 nn 个感兴趣视图且仅有一个作为它们之间桥梁的枢纽视图时也能工作。我们关注两个具体的下游应用:(i) 使用枢纽语言 LL 在语言 L1L_1L2L_2、...、LnL_n 之间进行迁移学习;(ii) 使用枢纽语言 L2L_2 实现图像与语言 L1L_1 之间的跨模态访问。我们的模型在公开的多语言 TED 语料库上的多语言文档分类中取得了最先进的性能,并在本工作创建并发布的新数据集上的多语言多模态检索中获得了有前景的结果。

关键词

引用

@article{arxiv.1510.03519,
  title  = {Bridge Correlational Neural Networks for Multilingual Multimodal Representation Learning},
  author = {Janarthanan Rajendran and Mitesh M. Khapra and Sarath Chandar and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1510.03519},
  year   = {2016}
}

备注

Published at NAACL-HLT 2016