语音的掩码建模对偶:利用去噪蒸馏将通用音频表征专门化于语音
音频与语音处理
2023-08-04 v3 声音
摘要
自监督学习的通用音频表征已在多种任务中展现出高性能。尽管它们可通过微调针对应用进行优化,但若能专门化用于某应用的预训练,则有望获得更高性能。本文以语音这一高要求领域为例,探讨将通用音频表征专门化于特定应用所面临的挑战与解决方案。我们增强通用模型掩码建模对偶(M2D)以缩小与最先进(SOTA)语音模型的性能差距。为此,我们提出新任务去噪蒸馏,以从细粒度聚类特征中学习,以及语音版掩码建模对偶(M2D-S),其联合学习去噪蒸馏任务与 M2D 掩码预测任务。实验结果表明,在 SUPERB 基准上 M2D-S 性能与 SOTA 语音模型相当或优于后者,证明 M2D 可在高要求领域中专门化。我们的代码见:https://github.com/nttcslab/m2d/tree/master/speech
引用
@article{arxiv.2305.14079,
title = {Masked Modeling Duo for Speech: Specializing General-Purpose Audio Representation to Speech using Denoising Distillation},
author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2305.14079},
year = {2023}
}
备注
Interspeech 2023; 5+2 pages, 2 figures, 6+6 tables, Code: https://github.com/nttcslab/m2d/tree/master/speech