中文

看、听与读:深度对齐表示

计算机视觉与模式识别 2017-06-06 v1

摘要

我们利用大量易得的同步数据来学习跨越三种主要自然模态(视觉、声音和语言)共享的深度判别表示。通过利用来自视频的超过一年的声音以及数百万与图像配对的句子,我们联合训练一个深度卷积网络用于对齐表示学习。我们的实验表明该表示对若干任务有用,例如跨模态检索或在模态间迁移分类器。此外,尽管我们的网络仅用图像+文本和图像+声音对训练,它也能在文本和声音之间迁移,这是网络在训练期间从未观察到的迁移。对我们表示的视觉化揭示了许多自动涌现以检测概念的隐藏单元,且与模态无关。

关键词

引用

@article{arxiv.1706.00932,
  title  = {See, Hear, and Read: Deep Aligned Representations},
  author = {Yusuf Aytar and Carl Vondrick and Antonio Torralba},
  journal= {arXiv preprint arXiv:1706.00932},
  year   = {2017}
}