中文

HuBERT-VIC:通过方差-不变性-协方差正则化改进语音基础模型的噪声鲁棒自动语音识别

声音 2025-08-19 v1 人工智能 音频与语音处理

摘要

语音基础模型(SFMs)的噪声鲁棒性一直是一个关键挑战,因为大多数模型主要在干净数据上训练,当模型暴露于带噪语音时会出现性能下降。为了解决这个问题,我们提出了 HuBERT-VIC,一种具有方差、不变性和协方差正则化(VICReg)目标的噪声鲁棒 SFM。这些目标调整了带噪语音表示的统计特性,使模型能够捕获多样的声学特征,并提高对不同类型噪声的泛化能力。当应用于 HuBERT 时,与在带噪语音上预训练的基线模型相比,我们的模型在 LibriSpeech test-clean 上相对性能提升了 23.3%,在 test-other 上提升了 13.2%。

关键词

引用

@article{arxiv.2508.12292,
  title  = {HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization},
  author = {Hyebin Ahn and Kangwook Jang and Hoirin Kim},
  journal= {arXiv preprint arXiv:2508.12292},
  year   = {2025}
}

备注

Accepted at Interspeech 2025