中文

语音的掩码建模对偶:利用去噪蒸馏将通用音频表征专门化于语音

音频与语音处理 2023-08-04 v3 声音

摘要

自监督学习的通用音频表征已在多种任务中展现出高性能。尽管它们可通过微调针对应用进行优化,但若能专门化用于某应用的预训练,则有望获得更高性能。本文以语音这一高要求领域为例,探讨将通用音频表征专门化于特定应用所面临的挑战与解决方案。我们增强通用模型掩码建模对偶(M2D)以缩小与最先进(SOTA)语音模型的性能差距。为此,我们提出新任务去噪蒸馏,以从细粒度聚类特征中学习,以及语音版掩码建模对偶(M2D-S),其联合学习去噪蒸馏任务与 M2D 掩码预测任务。实验结果表明,在 SUPERB 基准上 M2D-S 性能与 SOTA 语音模型相当或优于后者,证明 M2D 可在高要求领域中专门化。我们的代码见:https://github.com/nttcslab/m2d/tree/master/speech

关键词

引用

@article{arxiv.2305.14079,
  title  = {Masked Modeling Duo for Speech: Specializing General-Purpose Audio Representation to Speech using Denoising Distillation},
  author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2305.14079},
  year   = {2023}
}

备注

Interspeech 2023; 5+2 pages, 2 figures, 6+6 tables, Code: https://github.com/nttcslab/m2d/tree/master/speech