基于教师强制与计划采样的声音事件检测语言建模
声音
2019-11-07 v3 机器学习
音频与语音处理
摘要
声音事件检测(SED)方法通常以音频帧序列作为输入,并预测每帧中声音事件的活动情况。在真实录音中,声音事件表现出一定的时序结构:例如,“汽车喇叭”之后很可能会出现“汽车驶过”。虽然这种时序结构在序列预测任务(如机器翻译)中通过语言模型(LM)得到了广泛利用,但在SED中并未得到令人满意的建模。在本工作中,我们提出一种方法,使循环神经网络(RNN)能够为SED任务学习一个LM。该方法以先前时间步各类别的活动情况作为RNN输入的约束条件。我们使用F1分数和错误率(ER)在三个不同且公开可用的数据集上评估我们的方法:TUT-SED Synthetic 2016、TUT Sound Events 2016和2017数据集。所得结果表明,对于TUT Sound Events 2016和2017数据集,使用我们的方法后F1(越高越好)分别提升9%和2%,ER(越低越好)分别降低7%和2%。相反,对于TUT-SED Synthetic 2016数据集,使用我们的方法后F1分数下降4%,ER上升7%。
引用
@article{arxiv.1907.08506,
title = {Language Modelling for Sound Event Detection with Teacher Forcing and Scheduled Sampling},
author = {Konstantinos Drossos and Shayan Gharib and Paul Magron and Tuomas Virtanen},
journal= {arXiv preprint arXiv:1907.08506},
year = {2019}
}
备注
Fixed the display of URLs at footnote, updated the results