中文

会听声音的掩码自编码器

声音 2023-01-13 v3 人工智能 机器学习 音频与语音处理

摘要

本文研究了将基于图像的掩码自编码器(MAE)简单扩展至音频谱图自监督表示学习。遵循 MAE 中的 Transformer 编码器-解码器设计,我们的 Audio-MAE 首先以高掩码率编码音频谱图块,仅将未掩码的词元送入编码器层。解码器随后对填充了掩码词元的编码上下文重新排序并解码,以重建输入谱图。我们发现解码器中引入局部窗口注意力是有益的,因为音频谱图在局部时间和频带高度相关。我们随后以较低掩码率在目标数据集上微调编码器。实证上,Audio-MAE 在六项音频和语音分类任务上确立了新的 SOTA 性能,优于其他使用外部有监督预训练的近期模型。代码与模型将发布于 https://github.com/facebookresearch/AudioMAE。

关键词

引用

@article{arxiv.2207.06405,
  title  = {Masked Autoencoders that Listen},
  author = {Po-Yao Huang and Hu Xu and Juncheng Li and Alexei Baevski and Michael Auli and Wojciech Galuba and Florian Metze and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2207.06405},
  year   = {2023}
}

备注

Accepted at NeurIPS 2022