中文

基于聚类与独立子字典学习的隐式不平衡声音事件建模

音频与语音处理 2019-04-08 v1 声音

摘要

本文针对具有隐式数据量不平衡的声音事件频谱,提出了一种有效的建模方法,以改进声学事件检测(AED)。所提方法将每个事件建模为若干潜在因子的聚合表示,而传统方法试图直接从事件频谱中寻找声学元素。在该方法中,所有事件的所有潜在因子被赋予可比的重要性和复杂度,以克服事件频谱中数据量的隐式不平衡。为提取每个事件中的潜在因子,所提方法采用聚类并对每个潜在因子执行非负矩阵分解,将其声学元素学习为一个子字典。独立的子字典学习能有效以有限数据量对声学元素建模,并避免因训练数据中的隐式不平衡导致的过拟合。在 DCASE 2013 挑战赛的多音声音事件检测任务中,基于所提建模的 AED 取得了 46.5% 的检测 F 值,相比现有最先进方法显著提升超过 19%。

关键词

引用

@article{arxiv.1904.02852,
  title  = {Modelling of Sound Events with Hidden Imbalances Based on Clustering and Separate Sub-Dictionary Learning},
  author = {Chaitanya Narisetty and Tatsuya Komatsu and Reishi Kondo},
  journal= {arXiv preprint arXiv:1904.02852},
  year   = {2019}
}