从弱对齐数据中学习对齐的跨模态表示
计算机视觉与模式识别
2016-07-26 v1
摘要
人们可以在自然图像之外的许多不同模态中识别场景。在本文中,我们研究了如何学习可跨模态迁移的跨模态场景表示。为了研究这个问题,我们引入了一个新的跨模态场景数据集。虽然卷积神经网络可以很好地对跨模态场景进行分类,但它们也学习了一种未在模态间对齐的中间表示,这对于跨模态迁移应用来说是不可取的。我们提出了正则化跨模态卷积神经网络的方法,使其具有与模态无关的共享表示。我们的实验表明,我们的场景表示有助于为检索任务跨模态迁移表示。此外,我们的可视化结果表明,共享表示中出现的单元倾向于在与模态无关的一致概念上激活。
引用
@article{arxiv.1607.07295,
title = {Learning Aligned Cross-Modal Representations from Weakly Aligned Data},
author = {Lluis Castrejon and Yusuf Aytar and Carl Vondrick and Hamed Pirsiavash and Antonio Torralba},
journal= {arXiv preprint arXiv:1607.07295},
year = {2016}
}
备注
Conference paper at CVPR 2016