中文

BYOL for Audio:面向通用音频表征的自监督学习

音频与语音处理 2021-04-22 v2 机器学习 声音

摘要

受近期计算机视觉中利用数据增强生成监督的自监督学习进展的启发,我们探索了一种新的通用音频表征学习方法。我们提出从单一音频片段中学习通用音频表征,而不期望音频样本不同时间片段之间存在关联。为实现该原则,我们引入了 Bootstrap Your Own Latent (BYOL) for Audio(BYOL-A,读作“viola”),一种基于 BYOL 的学习通用音频表征的音频自监督学习方法。与大多数依赖邻近音频段一致或远端音频段不一致的先前音频自监督学习方法不同,BYOL-A 在从单一音频片段导出的增强音频段对中创建对比。结合归一化与增强技术,BYOL-A 在多种下游任务中取得了最先进的结果。广泛的消融实验也厘清了各组件及其组合的贡献。

关键词

引用

@article{arxiv.2103.06695,
  title  = {BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation},
  author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2103.06695},
  year   = {2021}
}

备注

IJCNN 2021, 8 pages, 4 figures