看、听与读:深度对齐表示
计算机视觉与模式识别
2017-06-06 v1
摘要
我们利用大量易得的同步数据来学习跨越三种主要自然模态(视觉、声音和语言)共享的深度判别表示。通过利用来自视频的超过一年的声音以及数百万与图像配对的句子,我们联合训练一个深度卷积网络用于对齐表示学习。我们的实验表明该表示对若干任务有用,例如跨模态检索或在模态间迁移分类器。此外,尽管我们的网络仅用图像+文本和图像+声音对训练,它也能在文本和声音之间迁移,这是网络在训练期间从未观察到的迁移。对我们表示的视觉化揭示了许多自动涌现以检测概念的隐藏单元,且与模态无关。
引用
@article{arxiv.1706.00932,
title = {See, Hear, and Read: Deep Aligned Representations},
author = {Yusuf Aytar and Carl Vondrick and Antonio Torralba},
journal= {arXiv preprint arXiv:1706.00932},
year = {2017}
}