自监督预训练用于恶劣条件下鲁棒的个性化语音活动检测
声音
2024-01-24 v2 机器学习
音频与语音处理
摘要
在本文中,我们提出使用大规模未标记数据集上的自监督预训练来提高个性化语音活动检测(VAD)模型在恶劣条件下的性能。我们使用自回归预测编码(APC)框架预训练一个长短期记忆(LSTM)编码器,并对其进行微调用于个性化VAD。我们还提出了一种APC的去噪变体,旨在提高个性化VAD的鲁棒性。训练好的模型在干净语音和受各种类型噪声污染的不同信噪比水平语音上进行了系统评估,并与纯监督模型进行了比较。我们的实验表明,自监督预训练不仅在干净条件下提高了性能,而且与纯监督学习相比,产生了对恶劣条件更鲁棒的模型。
引用
@article{arxiv.2312.16613,
title = {Self-supervised Pretraining for Robust Personalized Voice Activity Detection in Adverse Conditions},
author = {Holger Severin Bovbjerg and Jesper Jensen and Jan Østergaard and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2312.16613},
year = {2024}
}
备注
To be published at ICASSP2024, 14th of April 2024, Seoul, South Korea. Copyright (c) 2023 IEEE. 5 pages, 2, figures, 5 tables