deHuBERT:在自监督模型中解耦噪声以实现鲁棒语音识别
声音
2023-03-01 v1 音频与语音处理
摘要
现有的自监督预训练语音模型为利用海量无标注语料构建良好的自动语音识别(ASR)提供了有效途径。然而,许多当前模型在单一来源的干净语料上训练,在测试存在噪声时往往表现不佳。尽管如此,克服噪声的不利影响对于真实世界应用至关重要。本文受 H. Barlow 冗余缩减原理启发,提出一种名为 deHuBERT 的噪声抑制编码训练框架。该新框架通过引入辅助损失,将成对噪声失真嵌入之间的自相关与互相关矩阵推向单位矩阵,从而改进 HuBERT 训练算法。这促使模型产生与噪声无关的语音表征。使用该方法,我们报告了在含噪声环境(包括未见噪声)中鲁棒性的提升,且不损害干净集上的性能。
引用
@article{arxiv.2302.14597,
title = {deHuBERT: Disentangling Noise in a Self-supervised Model for Robust Speech Recognition},
author = {Dianwen Ng and Ruixi Zhang and Jia Qi Yip and Zhao Yang and Jinjie Ni and Chong Zhang and Yukun Ma and Chongjia Ni and Eng Siong Chng and Bin Ma},
journal= {arXiv preprint arXiv:2302.14597},
year = {2023}
}
备注
Accepted by ICASSP 2023