SoundNet:从无标签视频中学习声音表示
计算机视觉与模式识别
2016-10-31 v1 机器学习
声音
摘要
我们利用在真实环境中收集的大量无标签声音数据,学习丰富的自然声音表示。我们利用视觉与声音之间的自然同步,使用两百万个无标签视频来学习声学表示。无标签视频的优势在于可以以大规模经济地获取,同时包含关于自然声音的有用信号。我们提出一种师生训练过程,以无标签视频为桥梁,将已建立的视觉识别模型中的判别性视觉知识迁移到声音模态中。我们的声音表示在标准声学场景/物体分类基准上取得了优于 state-of-the-art 结果的显著性能提升。可视化表明,即使在没有真实标签训练的情况下,声音网络中也会自动浮现出一些高层语义。
引用
@article{arxiv.1610.09001,
title = {SoundNet: Learning Sound Representations from Unlabeled Video},
author = {Yusuf Aytar and Carl Vondrick and Antonio Torralba},
journal= {arXiv preprint arXiv:1610.09001},
year = {2016}
}
备注
NIPS 2016