中文

多标签开集音频分类

声音 2023-10-24 v1 音频与语音处理

摘要

当前音频分类模型相对于现实世界中大量关注的声音事件类别而言,类词汇量较小。因此,它们提供对世界有限的视角,可能遗漏重要但意外或未知的声音事件。为解决此问题,已开发开集音频分类技术以检测来自未知类别的声音事件。尽管这些方法已应用于音频中的多类场景(如声音场景分类),但尚未针对声音事件重叠、需使用多标签模型的复音音频进行研究。在本研究中,我们通过构建具有不同未知类分布的数据集并评估基于现有技术建立的基线方法,确立了多标签开集音频分类问题。

关键词

引用

@article{arxiv.2310.13759,
  title  = {Multi-label Open-set Audio Classification},
  author = {Sripathi Sridhar and Mark Cartwright},
  journal= {arXiv preprint arXiv:2310.13759},
  year   = {2023}
}

备注

Published at the Workshop on Detection and Classification of Acoustic Scenes and Events, 2023 (DCASE 2023)