利用强化学习改进音频事件检测器的后处理
声音
2022-08-22 v1 机器学习
音频与语音处理
摘要
我们对音频事件分类模型的类概率分布输出进行后处理,并采用强化学习联合搜索后处理栈各阶段的最优参数,例如分类阈值和用于平滑模型预测的中值滤波算法的核大小。为此,我们定义了一个强化学习环境,其中:1)状态是模型对给定音频样本给出的类概率分布;2)动作是为后处理栈每个参数选择候选最优值;3)奖励基于我们旨在优化的分类准确率度量,本例中为基于音频事件的宏 F1 分数。我们将后处理应用于提交至 DCASE Task4 2020 挑战赛的两个音频事件分类模型的类概率分布输出。我们发现,通过使用强化学习为应用于音频事件分类模型输出的后处理栈发现最优的逐类参数,与采用手动调参的相同后处理栈相比,基于音频事件的宏 F1 分数(DCASE 挑战赛中用于比较音频事件分类准确率的主要度量)可提升 4-5%。
引用
@article{arxiv.2208.09201,
title = {Improving Post-Processing of Audio Event Detectors Using Reinforcement Learning},
author = {Petros Giannakopoulos and Aggelos Pikrakis and Yannis Cotronis},
journal= {arXiv preprint arXiv:2208.09201},
year = {2022}
}
备注
Published on IEEE Access journal, Volume 10, 2022