中文

通过知识迁移、数据增强与预训练在小型数据集上最大化音频事件检测模型性能:一项消融研究

声音 2022-02-09 v1 机器学习 音频与语音处理

摘要

一个Xception模型通过从ImageNet权重进行知识迁移、在AudioSet上预训练以及在线数据增强流程,在ESC-50数据集上达到了音频事件检测的state-of-the-art(SOTA)精度。本文提出一项消融研究,分析哪些组件对性能和训练时间的提升有贡献。同时还提出了一个更小的Xception模型,其以几乎三分之一的参数接近SOTA性能。

关键词

引用

@article{arxiv.2202.03514,
  title  = {Maximizing Audio Event Detection Model Performance on Small Datasets Through Knowledge Transfer, Data Augmentation, And Pretraining: An Ablation Study},
  author = {Daniel Tompkins and Kshitiz Kumar and Jian Wu},
  journal= {arXiv preprint arXiv:2202.03514},
  year   = {2022}
}