多视图音频与音乐分类
声音
2021-03-04 v1 机器学习
音频与语音处理
摘要
我们在本工作中提出一种用于音频和音乐分类的多视图学习方法。考虑到音频和音乐识别任务常用的四种典型低级表示(即不同视图),所提出的多视图网络由四个子网络组成,每个子网络处理一种输入类型。子网络中学到的嵌入随后被拼接以形成多视图嵌入用于分类,类似于简单的拼接网络。然而,除联合分类分支外,该网络还在子网络的单视图嵌入上保持四个分类分支。然后提出一种新方法来跟踪分类分支上的学习行为,并自适应其权重以按比例混合它们的梯度用于网络训练。权重以如下方式自适应:在泛化良好的分支上的学习将受到鼓励,而在过拟合分支上的学习将被减缓。在三个不同的音频和音乐分类任务上的实验表明,所提出的多视图网络不仅优于单视图基线,而且优于基于拼接和后期融合的多视图基线。
引用
@article{arxiv.2103.02420,
title = {Multi-view Audio and Music Classification},
author = {Huy Phan and Huy Le Nguyen and Oliver Y. Chén and Lam Pham and Philipp Koch and Ian McLoughlin and Alfred Mertins},
journal= {arXiv preprint arXiv:2103.02420},
year = {2021}
}
备注
Accepted to ICASSP 2021