中文

SoundNet:从无标签视频中学习声音表示

计算机视觉与模式识别 2016-10-31 v1 机器学习 声音

摘要

我们利用在真实环境中收集的大量无标签声音数据,学习丰富的自然声音表示。我们利用视觉与声音之间的自然同步,使用两百万个无标签视频来学习声学表示。无标签视频的优势在于可以以大规模经济地获取,同时包含关于自然声音的有用信号。我们提出一种师生训练过程,以无标签视频为桥梁,将已建立的视觉识别模型中的判别性视觉知识迁移到声音模态中。我们的声音表示在标准声学场景/物体分类基准上取得了优于 state-of-the-art 结果的显著性能提升。可视化表明,即使在没有真实标签训练的情况下,声音网络中也会自动浮现出一些高层语义。

关键词

引用

@article{arxiv.1610.09001,
  title  = {SoundNet: Learning Sound Representations from Unlabeled Video},
  author = {Yusuf Aytar and Carl Vondrick and Antonio Torralba},
  journal= {arXiv preprint arXiv:1610.09001},
  year   = {2016}
}

备注

NIPS 2016