用于更好声学表征的跨模态监督学习
计算机视觉与模式识别
2020-01-03 v2 机器学习
声音
音频与语音处理
摘要
获取大规模人工标注数据集来训练声学表征模型是一项极具挑战性的任务。相反,我们可以轻易地收集带有机器生成标签的数据。在这项工作中,我们提出基于视觉与音频之间的同步性,利用机器生成标签来学习更好的声学表征。首先,我们收集了一个包含 1500 万样本、总时长 16,320 小时的大规模视频数据集。每个视频长度为 3 至 5 秒,并由公开的视觉和音频分类模型自动标注。其次,我们训练了多种经典卷积神经网络(CNNs),包括 VGGish、ResNet 50 和 Mobilenet v2。我们还对 VGGish 做了若干改进并取得了更好的结果。最后,我们将模型迁移到三个外部标准音频分类基准上,并相比当前最优结果取得了显著的性能提升。模型和代码可在 https://github.com/Deeperjia/vgg-like-audio-models 获取。
引用
@article{arxiv.1911.07917,
title = {Cross-modal supervised learning for better acoustic representations},
author = {Shaoyong Jia and Xin Shu and Yang Yang and Dawei Liang and Qiyue Liu and Junhui Liu},
journal= {arXiv preprint arXiv:1911.07917},
year = {2020}
}