中文

弱监督音频标注嵌入用于通用音频表示的实证研究

声音 2022-10-03 v1 音频与语音处理

摘要

我们研究了预训练的弱监督音频标注(AT)模型作为通用音频表示特征提取器的可用性。我们主要分析了将这些嵌入迁移到语音与声音领域内其他任务的可行性。具体而言,我们以弱监督预训练模型(MobileNetV2 和 EfficientNet-B0)与现代自监督学习方法(BYOL-A)作为特征提取器进行基准比较。评估使用了涵盖从乐器分类到语言分类的十四个下游任务。我们的结果表明,AT 预训练模型是音乐、事件与情感识别任务的极佳迁移学习选择。此外,微调 AT 模型也能惠及关键词 spotting 与意图分类等语音相关任务。

关键词

引用

@article{arxiv.2209.15167,
  title  = {An empirical study of weakly supervised audio tagging embeddings for general audio representations},
  author = {Heinrich Dinkel and Zhiyong Yan and Yongqing Wang and Junbo Zhang and Yujun Wang},
  journal= {arXiv preprint arXiv:2209.15167},
  year   = {2022}
}

备注

Odyssey 2022