基于掩码自编码器的通用语音增强器
声音
2026-02-03 v1 机器学习
摘要
监督式语音增强方法取得了很好的成功,但在实际场景中缺乏干净语音,迫切需要一种 self-supervised learning-based(SSL)语音增强方法,以在可应用于其他语音相关 downstream 应用的同时提供可 comparable 的增强性能。本文开发了一个基于掩码自编码器的 universal speech enhancer,使其对语音受到的 distortion 类型不敏感,可同时处理多种 distortion,并以自监督方式进行训练。一个 augmentation stack 为 noisy 输入数据添加额外的 distortion。掩码自编码器模型在 pre-training 时学习去除添加的 distortion 以及重建 spectrogram 被遮盖区域。随后使用预训练的嵌入项,对 fine-tuning 模型进行训练,后者在小量 paired 数据上用于特定 downstream 任务。我们评估了用于去噪和 dereverberation downstream 任务的预训练特征。我们探索了在 pre-training augmentation stack 中使用不同 augmentation(如 single 或 multi-speaker)以及不同 noisy 输入特征表示(如 compression)对预训练嵌入和 downstream fine-tuning 增强性能的影响。我们表明,所提出的方法不仅超过 baseline,还在 both in-domain 和 out-of-domain evaluation 数据集上实现了 state-of-the-art performance。
引用
@article{arxiv.2602.02413,
title = {Masked Autoencoders as Universal Speech Enhancer},
author = {Rajalaxmi Rajagopalan and Ritwik Giri and Zhiqiang Tang and Kyu Han},
journal= {arXiv preprint arXiv:2602.02413},
year = {2026}
}