中文

面向家庭环境中音频事件分类的开放集识别与少样本学习数据集

声音 2022-04-12 v8 机器学习 音频与语音处理

摘要

使用少量正样本进行训练的问题被称为少样本学习(FSL)。众所周知,传统的深度学习(DL)算法在大规模数据集上训练时通常表现出非常好的性能。然而,在许多应用中,无法获得如此大量的样本。在图像领域,典型的FSL应用包括与人脸识别相关的应用。在音频领域,音乐防伪或说话人识别显然可以从FSL方法中受益。本文研究将FSL应用于检测由不同类型声音警报(如门铃或火警)给出的特定且有意发出的声学事件,使用的样本数量有限。这些声音通常出现在家庭环境中,在那里发生着对应广泛声音类别的许多事件。因此,在实际场景中对这类警报的检测可被视为开放集识别(OSR)问题。为解决音频FSL缺乏专用公开数据集的问题,研究人员通常对其他可用数据集进行修改。本文旨在为音频识别社区提供一个精心标注的数据集(https://zenodo.org/record/3689288),用于OSR背景下的FSL,该数据集包含来自34个类别的1360个片段,分为模式声音和不期望声音。为促进和推动该领域的研究,本文还给出了基于迁移学习的当前最优基线系统的结果。

关键词

引用

@article{arxiv.2002.11561,
  title  = {An Open-set Recognition and Few-Shot Learning Dataset for Audio Event Classification in Domestic Environments},
  author = {Javier Naranjo-Alcazar and Sergi Perez-Castanos and Pedro Zuccarrello and Ana M. Torres and Jose J. Lopez and Franscesc J. Ferri and Maximo Cobos},
  journal= {arXiv preprint arXiv:2002.11561},
  year   = {2022}
}

备注

Submitted to IEEEAccess