中文

PSLA:通过预训练、采样、标注与聚合改进音频标注

声音 2021-11-18 v3 机器学习 音频与语音处理

摘要

音频标注是一个活跃的研究领域并具有广泛应用。自 AudioSet 发布以来,模型性能取得了巨大进步,这主要来自于新颖模型架构与注意力模块的发展。然而,我们发现恰当的训练技术对于使用 AudioSet 构建音频标注模型同样重要,却未得到应有的关注。为填补此空白,本工作中我们提出 PSLA,一套可显著提升模型准确率的训练技术,包括 ImageNet 预训练、平衡采样、数据增强、标签增强、模型聚合及其设计选择。通过使用这些技术训练一个 EfficientNet,我们得到了一个单一模型(含 13.6M 参数)和一个集成模型,在 AudioSet 上分别取得了 0.444 和 0.474 的平均精度均值(mAP)分数,优于此前最佳的 0.439(含 81M 参数)系统。此外,我们的模型在 FSD50K 上也取得了 0.567 的新的最先进 mAP。

关键词

引用

@article{arxiv.2102.01243,
  title  = {PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation},
  author = {Yuan Gong and Yu-An Chung and James Glass},
  journal= {arXiv preprint arXiv:2102.01243},
  year   = {2021}
}

备注

Published in IEEE/ACM Transactions on Audio Speech and Language Processing. Code at https://github.com/YuanGongND/psla