中文

AudRandAug:用于音频分类的随机图像增强方法

声音 2023-09-12 v1 人工智能 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

数据增强已被证明在训练神经网络中有效。近来,一种称为 RandAug 的方法被提出,其从预定义搜索空间中随机选取数据增强技术。RandAug 在图像相关任务中展现了显著的性能提升,同时带来极小的计算开销。然而,此前尚无研究探索 RandAug 专门应用于将音频转换为类图像模式的音频数据增强。为填补此空白,我们引入 AudRandAug,即 RandAug 面向音频数据的适配版本。AudRandAug 从专用的音频搜索空间中选取数据增强策略。为评估 AudRandAug 的有效性,我们使用多种模型与数据集进行了实验。我们的结果表明,在准确率性能方面,AudRandAug 优于其他现有数据增强方法。

关键词

引用

@article{arxiv.2309.04762,
  title  = {AudRandAug: Random Image Augmentations for Audio Classification},
  author = {Teerath Kumar and Muhammad Turab and Alessandra Mileo and Malika Bendechache and Takfarinas Saber},
  journal= {arXiv preprint arXiv:2309.04762},
  year   = {2023}
}

备注

Paper has accepted at 25th Irish Machine Vision and Image Processing Conference