中文

通用音频表示的多模态自监督学习

声音 2021-04-29 v2 音频与语音处理

摘要

我们提出一种多模态框架,从视频中学习通用音频表示。现有的对比音频表示学习方法在训练时主要仅使用音频模态。本工作中,我们表明视频中包含的额外信息可被用来大幅改进所学特征。首先,我们证明我们的对比框架不需要高分辨率图像即可学习良好的音频特征。这使我们能够扩大训练批量大小,同时将额外视频模态带来的计算负载保持在合理水平。其次,我们使用混合不同样本的增强方式。我们表明这能有效使代理任务更难,从而在增大批量大小时带来显著的性能提升。结果,我们的音频模型在AudioSet分类下游任务上取得了42.4 mAP的state-of-the-art,缩小了同一数据集上监督与自监督方法间的差距。此外,我们表明我们的方法在广泛的非语义音频任务上具有优势,包括说话人识别、关键词 spotting、语言识别和乐器分类。

关键词

引用

@article{arxiv.2104.12807,
  title  = {Multimodal Self-Supervised Learning of General Audio Representations},
  author = {Luyu Wang and Pauline Luc and Adria Recasens and Jean-Baptiste Alayrac and Aaron van den Oord},
  journal= {arXiv preprint arXiv:2104.12807},
  year   = {2021}
}