中文

用于音频事件分类的无监督判别性声音学习

声音 2021-05-21 v2 计算机视觉与模式识别 音频与语音处理

摘要

基于网络的音频事件分类近期进展显示了在 ImageNet 等视觉数据上预训练模型的益处。尽管该过程可实现跨领域知识迁移,但在大规模视觉数据集上训练模型十分耗时。在多个音频事件分类基准上,我们展示了一种快速有效的替代方案:仅基于音频数据以无监督方式预训练模型,却能达到与 ImageNet 预训练相当的性能。此外,我们表明我们的判别性音频学习可用于跨音频数据集迁移知识,并可选择性地结合 ImageNet 预训练。

关键词

引用

@article{arxiv.2105.09279,
  title  = {Unsupervised Discriminative Learning of Sounds for Audio Event Classification},
  author = {Sascha Hornauer and Ke Li and Stella X. Yu and Shabnam Ghaffarzadegan and Liu Ren},
  journal= {arXiv preprint arXiv:2105.09279},
  year   = {2021}
}

备注

ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) | 978-1-7281-7605-5/20/$31.00 (c) 2021 IEEE | DOI: 10.1109/ICASSP39728.2021.9413482