中文

从分类体系学习:面向日常声音识别的多标签小样本分类

声音 2022-12-20 v1 音频与语音处理

摘要

日常声音识别旨在推断音频流中声音事件的类型。尽管许多工作成功以全监督方式训练出高性能模型,但它们仍受限于对大量标注数据的需求和预定义类别的范围。为克服这些不足,本研究首先整理了一个名为FSD-FS的新数据库,用于多标签小样本音频分类。随后探索了如何将音频分类体系融入小样本学习。具体而言,本研究提出了标签依赖的原型网络(LaD-protonet),以利用标签间的父子关系。此外,还应用了分类体系感知的标签平滑技术来提升模型性能。实验表明,LaD-protonet优于原始原型网络以及其他最先进的方法。而且,当与分类体系感知的标签平滑相结合时,其性能可进一步提升。

关键词

引用

@article{arxiv.2212.08952,
  title  = {Learning from Taxonomy: Multi-label Few-Shot Classification for Everyday Sound Recognition},
  author = {Jinhua Liang and Huy Phan and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2212.08952},
  year   = {2022}
}

备注

submitted to ICASSP2023