面向弱标注声音事件检测的自适应池化算子
声音
2018-08-13 v2 机器学习
音频与语音处理
机器学习
摘要
声音事件检测(SED)方法的任务是通过活跃声源的存在情况为录音片段打标签。SED通常被表述为一个有监督机器学习问题,需要对录音中每个时刻每个声源的存在或缺失进行强标注。然而,此类强标注对人类标注者而言在劳力和成本上均十分昂贵,这限制了SED方法在实际中的可扩展性。在本工作中,我们将SED视为一个多示例学习(MIL)问题,其中训练标签在短片段内是静态的,指示声源的存在或缺失但不指示其时间位置。但模型仍须产生时间动态的预测,在训练中与静态标签比较时需将这些预测聚合(池化)。为便于此聚合,我们提出一类自适应池化算子——称为auto-pool——其在常用池化算子(如最小、最大或平均池化)之间平滑插值,并自动适应所关注声源的特性。我们在三个数据集上评估所提出的池化算子,并证明在每种情况下,所提方法在静态预测上均优于非自适应池化算子,且几乎匹配使用强动态标注训练的模型性能。所提方法与卷积神经网络结合评估,但可轻易应用于任何用于时间序列标签预测的可微分模型。
引用
@article{arxiv.1804.10070,
title = {Adaptive pooling operators for weakly labeled sound event detection},
author = {Brian McFee and Justin Salamon and Juan Pablo Bello},
journal= {arXiv preprint arXiv:1804.10070},
year = {2018}
}