通过自监督预训练实现对目标说话人语音活动检测的噪声鲁棒性
音频与语音处理
2025-01-07 v1 机器学习
声音
摘要
目标说话人语音活动检测(TS-VAD)是检测已知目标说话人在音频帧中是否存在语音的任务。最近的研究表明,基于深度神经网络的模型在该任务中表现良好。然而,这些模型的训练需要大量标记数据,在若干未见环境下的泛化能力至关重要时,这些数据获取成本高昂且耗时。为缓解这一问题,我们提出一种因果自监督学习(SSL)预训练框架,称为去噪自回归预测编码(DN-APC),以提高 TS-VAD 在噪声环境下的性能。我们还探索了各种说话人条件方法,并在不同噪声条件下评估其性能。我们的实验表明,DN-APC 在噪声环境下的性能得到提高,在见和未见噪声环境中均可实现约 2% 的一般性提升。此外,我们发现 FiLM 条件方法综合性能最佳。通过 t-SNE 图表示分析,揭示了该预训练方法对语音和非语音的初始表征具有鲁棒性。这凸显了自监督预训练在提高 TS-VAD 模型在噪声环境下的鲁棒性和性能方面的有效性。
引用
@article{arxiv.2501.03184,
title = {Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining},
author = {Holger Severin Bovbjerg and Jan Østergaard and Jesper Jensen and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2501.03184},
year = {2025}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing for possible publication. 12 pages, 4 figures, 5 tables