EnCodecMAE:利用神经编解码器进行通用音频表征学习
声音
2024-05-22 v2 机器学习
音频与语音处理
摘要
通用音频表征学习的目标是获得可用于涉及语音、音乐和环境声音等多种下游任务的基础模型。针对该问题,常将受 NLP(如 BERT)或计算机视觉(如掩码自编码器 MAE)自监督学习工作启发的方法适配至音频领域。本工作中,我们提出对音频信号的表征进行掩码,并训练一个 MAE 来重建被掩码片段。重建通过从非掩码输入预测由神经音频编解码器 EnCodec 生成的离散单元来实现。我们在涉及语音、音乐和环境声音的广泛任务上评估了这一称为 EnCodecMAE 的方法。我们的最佳模型在全球性能上优于多种最先进的音频表征模型。此外,我们在自动语音识别(ASR)这一挑战性任务上评估了所得表征,取得了不错的结果,并为通用音频表征铺平了道路。
引用
@article{arxiv.2309.07391,
title = {EnCodecMAE: Leveraging neural codecs for universal audio representation learning},
author = {Leonardo Pepino and Pablo Riera and Luciana Ferrer},
journal= {arXiv preprint arXiv:2309.07391},
year = {2024}
}