中文

MAE-AST:掩码自编码音频频谱图 Transformer

音频与语音处理 2022-04-01 v1 人工智能 计算与语言 机器学习 声音

摘要

在本文中,我们提出了一种简单而强大的改进方法,用于改进近期用于语音和音频分类的自监督音频频谱图 Transformer(SSAST)模型。具体而言,我们利用这样一个洞见:SSAST 在预训练期间使用了非常高的掩码比例(75%),这意味着绝大多数自注意力计算都在掩码 token 上执行。我们通过将掩码自编码器是可扩展的视觉学习器(MAE)中的编码器-解码器架构整合到 SSAST 中来解决这一问题,其中深度编码器仅对未掩码输入进行操作,而浅层解码器对编码器输出和掩码 token 进行操作。我们发现,在使用普通模型和输入尺寸的当前音频预训练策略下,类 MAE 的预训练相比原始 SSAST 可提供 3 倍加速和 2 倍内存使用量减少。在对仅使用编码器的下游任务进行微调时,我们发现我们的方法在多种下游任务上优于 SSAST。我们进一步对不同的预训练策略进行了全面评估,并探讨了视觉与音频领域之间类 MAE 风格预训练的差异。

关键词

引用

@article{arxiv.2203.16691,
  title  = {MAE-AST: Masked Autoencoding Audio Spectrogram Transformer},
  author = {Alan Baade and Puyuan Peng and David Harwath},
  journal= {arXiv preprint arXiv:2203.16691},
  year   = {2022}
}

备注

Submitted to INTERSPEECH. 5 pages, 2 figures, 5 tables