通过知识迁移、数据增强与预训练在小型数据集上最大化音频事件检测模型性能:一项消融研究
声音
2022-02-09 v1 机器学习
音频与语音处理
摘要
一个Xception模型通过从ImageNet权重进行知识迁移、在AudioSet上预训练以及在线数据增强流程,在ESC-50数据集上达到了音频事件检测的state-of-the-art(SOTA)精度。本文提出一项消融研究,分析哪些组件对性能和训练时间的提升有贡献。同时还提出了一个更小的Xception模型,其以几乎三分之一的参数接近SOTA性能。
引用
@article{arxiv.2202.03514,
title = {Maximizing Audio Event Detection Model Performance on Small Datasets Through Knowledge Transfer, Data Augmentation, And Pretraining: An Ablation Study},
author = {Daniel Tompkins and Kshitiz Kumar and Jian Wu},
journal= {arXiv preprint arXiv:2202.03514},
year = {2022}
}