EAT:基于高效音频 Transformer 的自监督预训练
音频与语音处理
2024-01-09 v1 人工智能
计算与语言
机器学习
声音
摘要
音频自监督学习(SSL)预训练旨在从无标签音频中学习优良表征,已取得显著进展。然而,预训练过程中巨大的计算需求对音频 SSL 模型的潜在应用与优化构成了重大障碍。本文受 image modality 中 data2vec 2.0 和 audio modality 中 Audio-MAE 成功的启发,提出高效音频 Transformer(Efficient Audio Transformer, EAT),以进一步提升音频 SSL 的有效性与效率。所提出的 EAT 将 bootstrap 自监督训练范式应用于音频领域。我们设计了一种新颖的语句 - 帧目标(Utterance-Frame Objective, UFO)以增强对声学事件的建模能力。此外,我们揭示了掩码策略在音频 SSL 预训练中的关键作用,并表明采用大型逆块掩码可获得更优的音频表征。实验结果表明,EAT 在一系列音频相关任务上达到了最先进(SOTA)性能,包括 AudioSet(AS-2M, AS-20K)、ESC-50 和 SPC-2,同时与现有音频 SSL 模型相比,预训练速度显著提升高达约 15 倍。
引用
@article{arxiv.2401.03497,
title = {EAT: Self-Supervised Pre-Training with Efficient Audio Transformer},
author = {Wenxi Chen and Yuzhe Liang and Ziyang Ma and Zhisheng Zheng and Xie Chen},
journal= {arXiv preprint arXiv:2401.03497},
year = {2024}
}