语音识别、语音增强与自监督学习表示的端到端集成
声音
2022-04-04 v1 计算与语言
音频与语音处理
摘要
本工作提出我们面向鲁棒语音识别的端到端(E2E)自动语音识别(ASR)模型,称为 IRIS(集成增强语音输入与自监督学习表示的语音识别)。相比传统 E2E ASR 模型,所提 E2E 模型集成了两个重要模块:语音增强(SE)模块与自监督学习表示(SSLR)模块。SE 模块增强带噪语音,随后 SSLR 模块从增强语音中提取特征用于语音识别(ASR)。为训练所提模型,我们建立了高效的学习方案。在单通道 CHiME-4 任务上的评测结果表明,得益于强大的预训练 SSLR 模块与微调的 SE 模块,IRIS 模型在单通道 CHiME-4 基准上取得了文献报道的最佳性能(真实开发集 2.0%,真实测试集 3.9%)。
引用
@article{arxiv.2204.00540,
title = {End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation},
author = {Xuankai Chang and Takashi Maekaku and Yuya Fujita and Shinji Watanabe},
journal= {arXiv preprint arXiv:2204.00540},
year = {2022}
}
备注
Submitted to Interspeech 2022