跨模态场景网络
计算机视觉与模式识别
2016-10-31 v1 机器学习
多媒体
摘要
人们能够超越自然图像,在许多不同模态下识别场景。本文中,我们研究如何学习可跨模态迁移的跨模态场景表示。为研究该问题,我们引入一个新的跨模态场景数据集。虽然卷积神经网络能很好地对场景分类,但它们也学习到跨模态未对齐的中间表示,这不利于跨模态迁移应用。我们提出对跨模态卷积神经网络进行正则化的方法,使其具有与模态无关的共享表示。我们的实验表明,我们的场景表示有助于跨模态检索的表示迁移。此外,我们的可视化表明,共享表示中出现了一些单元,它们倾向于独立于模态地对一致概念激活。
引用
@article{arxiv.1610.09003,
title = {Cross-Modal Scene Networks},
author = {Yusuf Aytar and Lluis Castrejon and Carl Vondrick and Hamed Pirsiavash and Antonio Torralba},
journal= {arXiv preprint arXiv:1610.09003},
year = {2016}
}
备注
See more at http://cmplaces.csail.mit.edu/. arXiv admin note: text overlap with arXiv:1607.07295