迈向通用音频表征学习
声音
2022-06-24 v3 音频与语音处理
摘要
学习能够解决多样化语音、音乐和环境任务的通用音频表征的能力,可推动许多需要通用声音内容理解的应用。在本工作中,我们引入了一个涵盖音频领域 12 个下游任务的完整音频表征评估套件(HARES),并对近期声音表征学习系统在该基准上进行了详尽的实证研究。我们发现,先前的声音事件分类或语音模型无法泛化到其领域之外。我们观察到,使用 SimCLR 目标可以学习到更鲁棒的音频表征;然而,模型的迁移能力严重依赖于模型架构。我们发现 Slowfast 架构善于学习不同领域所需的丰富表征,但其性能受归一化方案影响。基于这些发现,我们提出了一种新型无归一化器 Slowfast NFNet,并在所有领域上取得了最先进的性能。
引用
@article{arxiv.2111.12124,
title = {Towards Learning Universal Audio Representations},
author = {Luyu Wang and Pauline Luc and Yan Wu and Adria Recasens and Lucas Smaira and Andrew Brock and Andrew Jaegle and Jean-Baptiste Alayrac and Sander Dieleman and Joao Carreira and Aaron van den Oord},
journal= {arXiv preprint arXiv:2111.12124},
year = {2022}
}