中文

BYOL for Audio:探索预训练通用音频表征

音频与语音处理 2023-02-24 v2 声音

摘要

预训练模型作为特征提取器,在现代各领域的机器学习系统中至关重要。本研究假设,对通用音频任务有效的表征应提供输入声音的多方面鲁棒特征。为在音高或音色等扰动变化下仍能识别声音,特征应对这些扰动具有鲁棒性。为满足情感或音乐流派识别等多样化任务需求,表征应提供局部与全局特征等多方面的信息。为实现我们的原则,我们提出一种自监督学习方法:Bootstrap Your Own Latent (BYOL) for Audio(BYOL-A,读作“viola”)。BYOL-A 对输入声音的表征进行预训练,使其对音频数据增强保持不变性,从而使学到的表征对声音扰动具有鲁棒性。而 BYOL-A 编码器结合局部与全局特征并计算其统计量,使表征提供多方面信息。因此,学到的表征应提供鲁棒且多方位的信息,以满足不同任务的多样需求。我们将 BYOL-A 的通用音频任务性能与先前最先进方法进行比较,BYOL-A 展现出泛化能力,取得 72.4% 的最佳平均结果和 57.6% 的最佳 VoxCeleb1 结果。大量消融实验表明,BYOL-A 编码器架构对大部分性能有贡献,最终关键部分归于 BYOL 框架与 BYOL-A 增强。我们的代码已在线发布于 https://github.com/nttcslab/byol-a 以供后续研究。

关键词

引用

@article{arxiv.2204.07402,
  title  = {BYOL for Audio: Exploring Pre-trained General-purpose Audio Representations},
  author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2204.07402},
  year   = {2023}
}

备注

15 pages, 6 figures, and 15 tables. Under the review process