中文

谁主沉浮?重新思考音频少样本学习

声音 2021-10-20 v1 音频与语音处理

摘要

少样本学习旨在训练模型,使其仅给定少量标注样本(即支持集)即可识别新类别。尽管该领域近年取得显著进展,但常聚焦于多类图像分类。相比之下,音频常因声音重叠而呈多标签,具有复音性和信噪比(SNR)等独特属性。这引发了关于此类音频属性对少样本学习系统设计、性能及人机交互影响的未解问题,因为通常需由用户收集并提供推理时支持集样本。我们通过一系列旨在阐明这些问题的实验来作答。我们引入两个新颖数据集 FSD-MIX-CLIPS 和 FSD-MIX-SED,其程序化生成使我们能系统探究这些问题。我们的实验得出音频特定的少样本学习洞察,其中部分与图像域近期发现相悖:不存在万能最佳模型、方法与支持集选择准则。相反,它取决于预期应用场景。我们的代码与数据见 https://github.com/wangyu/rethink-audio-fsl。

关键词

引用

@article{arxiv.2110.09600,
  title  = {Who calls the shots? Rethinking Few-Shot Learning for Audio},
  author = {Yu Wang and Nicholas J. Bryan and Justin Salamon and Mark Cartwright and Juan Pablo Bello},
  journal= {arXiv preprint arXiv:2110.09600},
  year   = {2021}
}

备注

WASPAA 2021