中文

软中位数选择:一种用于声音事件检测的自动特征平滑方法

音频与语音处理 2021-03-23 v3

摘要

在声音事件检测(SED)系统中,由于若干问题,用于后处理的中值滤波器长度在训练过程中从未被优化。这些长度不接收梯度,因此无法在反向传播中学习。插入模型中的中值滤波还会造成梯度流动阻塞,且平滑过程因忽略误差而误导模型。为解决这些问题,我们提供经不同程度平滑的特征通道及原始特征,使模型能在认知所有误差的同时优化权重。随后我们使用线性层整合结果并产生线性组合。我们进一步设计软中位数函数以疏通梯度流。所提框架称为软中位数选择(SMC)。实验表明,SMC 模块不仅能基于训练集自动平滑特征,还迫使模型提取声音事件所有帧共享的共性特征。所提方法的性能在验证集与评测集上均以基于事件的 F1 分数(EBFS)超出基线 10% 以上,并也轻微优于最先进 SED 系统的单一模型。

关键词

引用

@article{arxiv.2011.12564,
  title  = {Soft-Median Choice: An Automatic Feature Smoothing Method for Sound Event Detection},
  author = {Fengnian Zhao and Ruwei Li and Xin Liu and Liwen Xu},
  journal= {arXiv preprint arXiv:2011.12564},
  year   = {2021}
}

备注

5 pages, 3 figures, 6 tables