利用单通道语音进行多通道端到端语音识别的比较研究
音频与语音处理
2022-10-11 v2 计算与语言
摘要
近年来,多通道ASR的端到端训练方法已显现其有效性,其通常由波束成形前端与识别后端组成。然而,由于多模块集成,端到端训练变得更加困难,尤其考虑到真实环境中记录的多通道语音数据规模有限。这引发了对利用单通道数据进行多通道端到端ASR的需求。本文在不同设置(如单通道数据规模与前端选择)下,系统比较了三种利用外部单通道数据用于多通道端到端ASR的方案,即后端预训练、数据调度与数据仿真。在CHiME-4与AISHELL-4数据集上的大量实验表明,尽管三种方法均提升了多通道端到端语音识别性能,数据仿真以更长训练时间为代价优于另外两种。数据调度较后端预训练边际但近乎一致地占优,推测原因是在预训练阶段后端易对单通道数据过拟合,尤其在单通道数据规模较小时。
引用
@article{arxiv.2203.16757,
title = {Exploiting Single-Channel Speech for Multi-Channel End-to-End Speech Recognition: A Comparative Study},
author = {Keyu An and Ji Xiao and Zhijian Ou},
journal= {arXiv preprint arXiv:2203.16757},
year = {2022}
}
备注
Accepted by ISCSLP 2022. arXiv admin note: substantial text overlap with arXiv:2107.02670