基于替代梯度学习的多标签音频标注快速阈值优化
人工智能
2021-03-02 v1 声音
音频与语音处理
摘要
多标签音频标注包括将标签集合分配给音频录音。在推理时,对概率分类器输出的置信度分数施加阈值,以决定检测到哪些类别处于活跃状态。在本工作中,我们考虑已拥有一个训练好的分类器,并寻求根据感兴趣的性能度量(本例中为F-measure(micro-F1))自动优化决策阈值。我们提出一种称为SGL-Thresh(Surrogate Gradient Learning of Thresholds,阈值替代梯度学习)的新方法,其利用梯度下降。由于F1不可微,我们提出用sigmoid函数的梯度来近似阈值操作的梯度。我们在三个数据集上使用最先进的预训练深度神经网络报告了实验。在所有情况下,SGL-Thresh均优于另外三种方法:默认阈值(defThresh)、启发式搜索算法以及数值估计F1梯度的方法。其在AudioSet eval上达到54.9% F1,而defThresh为50.7%。SGL-Thresh非常快速且可扩展至大量标签。为促进可复现性,Pytorch中的数据与源代码已在线提供:https://github.com/topel/SGL-Thresh
引用
@article{arxiv.2103.00833,
title = {Fast threshold optimization for multi-label audio tagging using Surrogate gradient learning},
author = {Thomas Pellegrini and Timothée Masquelier},
journal= {arXiv preprint arXiv:2103.00833},
year = {2021}
}