中文

音频自监督学习:综述

声音 2022-03-03 v1 人工智能 音频与语音处理

摘要

受人类泛化知识与技能认知能力的启发,自监督学习(SSL)旨在无需人工标注(一项昂贵且耗时的工作)的情况下从大规模数据中发现通用表示。其在计算机视觉与自然语言处理领域的成功促使近期被引入音频与语音处理领域。目前缺少总结音频 SSL 知识的综合性综述。为填补此空白,在本工作中,我们概述用于音频与语音处理应用的 SSL 方法。此外,我们总结了在多模态 SSL 框架中利用音频模态的经验工作,以及用于评估计算机听觉领域 SSL 能力的现有合适基准。最后,我们讨论了一些开放问题并指出音频 SSL 发展的未来方向。

关键词

引用

@article{arxiv.2203.01205,
  title  = {Audio Self-supervised Learning: A Survey},
  author = {Shuo Liu and Adria Mallol-Ragolta and Emilia Parada-Cabeleiro and Kun Qian and Xin Jing and Alexander Kathan and Bin Hu and Bjoern W. Schuller},
  journal= {arXiv preprint arXiv:2203.01205},
  year   = {2022}
}