基于注意力模型的 Audio Set 分类:一种概率视角
声音
2019-12-10 v2 音频与语音处理
摘要
本文研究 Audio Set 数据集的分类。Audio Set 是一个大规模弱标注的声音片段数据集。先前工作使用多示例学习(MIL)对弱标注数据进行分类。在 MIL 中,一个包由若干示例组成,若音频片段中至少有一个示例为正,则该包被标为正;若包中所有示例均为负,则该包被标为负。我们提出一种注意力模型来解决 MIL 问题,并从一种新颖的概率视角解释该注意力模型。我们在每个包上定义一个概率空间,其中包中每个示例对每一类都有一个可训练的概率测度。那么一个包的分类即为包中示例的分类输出关于所学概率测度的期望。实验结果表明,我们提出的由全连接深度神经网络建模的注意力模型在 Audio Set 数据集上获得了 0.327 的 mAP,优于 Google 的基线 0.314 和循环神经网络(RNN)的 0.325。
引用
@article{arxiv.1711.00927,
title = {Audio Set classification with attention model: A probabilistic perspective},
author = {Qiuqiang Kong and Yong Xu and Wenwu Wang and Mark D. Plumbley},
journal= {arXiv preprint arXiv:1711.00927},
year = {2019}
}
备注
Accepted by ICASSP 2018