基于连接时序分类与无监督聚类的序列标注数据声音事件检测
声音
2019-04-30 v1 音频与语音处理
摘要
声音事件检测(SED)方法通常依赖于强标注数据或弱标注数据。作为替代,序列标注数据(SLD)被提出。在 SLD 中,音频片段中事件及其顺序已知,但不知事件发生时间。本文提出了一种基于连接时序分类(CTC)的 SED 系统,其使用 SLD 而非强标注数据,并带有一个新颖的无监督聚类阶段。在 41 类声音事件上的实验表明,所提出的基于 SLD 训练的两阶段方法取得了与先前基于强标注数据训练的最优 SED 系统相当的性能,且远优于另一基于弱标注数据训练的最优 SED 系统,这表明所提出的基于 SLD 训练的两阶段方法在没有任何声音事件起止时间下的有效性。
引用
@article{arxiv.1904.12102,
title = {Sound Event Detection with Sequentially Labelled Data Based on Connectionist Temporal Classification and Unsupervised Clustering},
author = {Yuanbo Hou and Qiuqiang Kong and Shengchen Li and Mark D. Plumbley},
journal= {arXiv preprint arXiv:1904.12102},
year = {2019}
}