面向开放集声音场景分析的可扩展簇图分类法
声音
2018-09-27 v1 音频与语音处理
摘要
我们提出了一种用于开放集声音场景分析的新可扩展且可拆分分类法。该新模型允许使用可触知描述符与感知标签进行复杂场景分析。其新颖结构是一个簇图,使得每个簇(或子集)可独立用于目标分析(如办公室声音事件检测),同时保持整个标签图(超集)的完整性。关键设计益处在于其可扩展性,可在新数据采集过程中按需加入新标签。此外,使用相同分类法的数据集易于扩充,节省了未来的数据收集工作。我们通过框架平衡复杂场景分析所需细节与避免“万物分类法”,以确保标签超集中无重复,并利用 DCASE 挑战赛分类展示了这一点。
引用
@article{arxiv.1809.10047,
title = {An extensible cluster-graph taxonomy for open set sound scene analysis},
author = {Helen L Bear and Emmanouil Benetos},
journal= {arXiv preprint arXiv:1809.10047},
year = {2018}
}
备注
To be presented at Detection and Classification of Audio Scenes and Events (DCASE) workshop, November 2018