中文

从原始感官输入中联合发现视觉对象与口语词

计算机视觉与模式识别 2018-04-05 v1 计算与语言 声音

摘要

本文探讨神经网络模型,其学习将口语音频字幕的片段与它们所指自然图像中语义相关部分相关联。我们证明这些视听关联定位涌现于网络内部表征——该表征是训练执行图像-音频检索任务的副产品。我们的模型直接作用于图像像素与语音波形,训练期间不依赖任何常规监督形式(如标签、分割或模态间对齐)。我们使用 Places 205 与 ADE20k 数据集进行分析,表明我们的模型隐式学习了语义耦合的对象与词检测器。

关键词

引用

@article{arxiv.1804.01452,
  title  = {Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input},
  author = {David Harwath and Adrià Recasens and Dídac Surís and Galen Chuang and Antonio Torralba and James Glass},
  journal= {arXiv preprint arXiv:1804.01452},
  year   = {2018}
}