利用目标说话人提取与神经不确定性估计改进 RNN 转导器
声音
2021-03-01 v2 音频与语音处理
摘要
目标说话人语音识别旨在从带有背景噪声和干扰说话人的噪声环境中识别目标说话人语音。本工作提出一个联合框架,将时域目标说话人语音提取与循环神经网络转导器(RNN-T)相结合。为稳定联合训练,我们提出一种多阶段训练策略,在联合训练前对系统中各模块进行预训练与微调。同时,提出说话人身份与语音增强不确定性度量,以补偿来自目标语音提取模块的残差噪声与伪影。相较于使用目标语音提取模型微调的识别器,我们的实验表明,添加神经不确定性模块在多说话人含背景噪声信号上显著降低了 17% 的相对字符错误率(CER)。多条件实验表明,我们的方法在噪声条件下可实现 9% 的相对性能提升,同时在干净条件下保持性能。
引用
@article{arxiv.2011.13393,
title = {Improving RNN Transducer With Target Speaker Extraction and Neural Uncertainty Estimation},
author = {Jiatong Shi and Chunlei Zhang and Chao Weng and Shinji Watanabe and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:2011.13393},
year = {2021}
}
备注
Accepted by ICASSP2021