中文

BEATs: 基于声学分词器的音频预训练

音频与语音处理 2022-12-20 v1 人工智能 计算与语言 机器学习 声音

摘要

过去几年,自监督学习(SSL)在语言、视觉、语音和音频领域取得了巨大发展。虽然离散标签预测在其他模态中被广泛采用,但最先进的音频SSL模型在预训练中仍使用重建损失。与重建损失相比,富含语义的离散标签预测能促使SSL模型像人类感知一样,抽象出高级音频语义并丢弃冗余细节。然而,由于音频的连续性以及缺乏像语音那样的音素序列,为通用音频预训练获取一个富含语义的声学分词器通常并非易事。为应对这一挑战,我们提出了BEATs,一个迭代式音频预训练框架,用于从音频Transformer学习双向编码器表示,其中声学分词器和音频SSL模型通过迭代进行优化。在第一次迭代中,我们使用随机投影作为声学分词器,以掩码和标签预测的方式训练音频SSL模型。然后,我们通过从预训练或微调的音频SSL模型中蒸馏语义知识,为下一次迭代训练一个声学分词器。重复此迭代过程,以期实现声学分词器和音频SSL模型的相互促进。实验结果表明,我们的声学分词器能够生成具有丰富音频语义的离散标签,并且我们的音频SSL模型在各种音频分类基准上取得了最先进的结果,甚至显著优于那些使用更多训练数据和模型参数的先前模型。具体来说,我们在AudioSet-2M上为仅使用音频的模型设定了50.6% mAP的新最先进水平,并在ESC-50上达到了98.1%的准确率。代码和预训练模型可在https://aka.ms/beats获取。

关键词

引用

@article{arxiv.2212.09058,
  title  = {BEATs: Audio Pre-Training with Acoustic Tokenizers},
  author = {Sanyuan Chen and Yu Wu and Chengyi Wang and Shujie Liu and Daniel Tompkins and Zhuo Chen and Furu Wei},
  journal= {arXiv preprint arXiv:2212.09058},
  year   = {2022}
}