中文

从弱对齐数据中学习对齐的跨模态表示

计算机视觉与模式识别 2016-07-26 v1

摘要

人们可以在自然图像之外的许多不同模态中识别场景。在本文中,我们研究了如何学习可跨模态迁移的跨模态场景表示。为了研究这个问题,我们引入了一个新的跨模态场景数据集。虽然卷积神经网络可以很好地对跨模态场景进行分类,但它们也学习了一种未在模态间对齐的中间表示,这对于跨模态迁移应用来说是不可取的。我们提出了正则化跨模态卷积神经网络的方法,使其具有与模态无关的共享表示。我们的实验表明,我们的场景表示有助于为检索任务跨模态迁移表示。此外,我们的可视化结果表明,共享表示中出现的单元倾向于在与模态无关的一致概念上激活。

关键词

引用

@article{arxiv.1607.07295,
  title  = {Learning Aligned Cross-Modal Representations from Weakly Aligned Data},
  author = {Lluis Castrejon and Yusuf Aytar and Carl Vondrick and Hamed Pirsiavash and Antonio Torralba},
  journal= {arXiv preprint arXiv:1607.07295},
  year   = {2016}
}

备注

Conference paper at CVPR 2016