中文

跨模态场景网络

计算机视觉与模式识别 2016-10-31 v1 机器学习 多媒体

摘要

人们能够超越自然图像,在许多不同模态下识别场景。本文中,我们研究如何学习可跨模态迁移的跨模态场景表示。为研究该问题,我们引入一个新的跨模态场景数据集。虽然卷积神经网络能很好地对场景分类,但它们也学习到跨模态未对齐的中间表示,这不利于跨模态迁移应用。我们提出对跨模态卷积神经网络进行正则化的方法,使其具有与模态无关的共享表示。我们的实验表明,我们的场景表示有助于跨模态检索的表示迁移。此外,我们的可视化表明,共享表示中出现了一些单元,它们倾向于独立于模态地对一致概念激活。

关键词

引用

@article{arxiv.1610.09003,
  title  = {Cross-Modal Scene Networks},
  author = {Yusuf Aytar and Lluis Castrejon and Carl Vondrick and Hamed Pirsiavash and Antonio Torralba},
  journal= {arXiv preprint arXiv:1610.09003},
  year   = {2016}
}

备注

See more at http://cmplaces.csail.mit.edu/. arXiv admin note: text overlap with arXiv:1607.07295