语音识别、去混响、波束成形与自监督学习表征的端到端集成
声音
2022-10-20 v1 音频与语音处理
摘要
自监督学习表征(SSLR)已在自动语音识别(ASR)中展现出显著有效性,主要用于干净语音。近期工作指出了将 SSLR 与单通道语音增强相集成以用于噪声环境下 ASR 的优势。本文通过处理多通道输入进一步推进了这一集成。我们提出了一种新颖的端到端架构,在单一神经网络中集成去混响、波束成形、SSLR 和 ASR。我们的系统在 CHiME-4 六通道赛道上取得了文献中报道的最佳性能,词错误率(WER)为 1.77%。尽管基于 WavLM 的强 SSLR 本身已展现出有前景的结果,但与加权功率最小化无失真响应波束成形器(同时执行去混响和去噪)的端到端集成显著改善了 WER。其有效性也在 REVERB 数据集上得到验证。
引用
@article{arxiv.2210.10742,
title = {End-to-End Integration of Speech Recognition, Dereverberation, Beamforming, and Self-Supervised Learning Representation},
author = {Yoshiki Masuyama and Xuankai Chang and Samuele Cornell and Shinji Watanabe and Nobutaka Ono},
journal= {arXiv preprint arXiv:2210.10742},
year = {2022}
}
备注
Accepted to IEEE SLT 2022