RoyalFlush语音识别系统用于M2MeT挑战赛
声音
2022-02-25 v2 音频与语音处理
机器学习
摘要
本文描述了我们用于M2MeT挑战赛多说话人自动语音识别(ASR)赛道的RoyalFlush系统。我们采用了基于序列化输出训练(SOT)的多说话人ASR系统及大规模仿真数据。首先,我们研究了一系列前端方法,包括多通道加权预测误差(WPE)、波束成形、语音分离、语音增强等,以处理训练、验证和测试集。但根据实验结果,我们仅选取WPE和波束成形作为前端方法。其次,我们在多说话人ASR的数据增广上付出巨大努力,主要包括加噪与混响、重叠语音仿真、多通道语音仿真、速度扰动、前端处理等,这带来了显著的性能提升。最后,为充分利用不同模型架构的性能互补性,我们训练了标准的基于conformer的联合CTC/注意力(Conformer)模型以及带有双向注意力解码器(Conformer的改进版)的U2++ ASR模型,以融合其结果。相比官方基线系统,我们的系统在验证集上绝对字符错误率(CER)降低12.22%,在测试集上降低12.11%。
引用
@article{arxiv.2202.01614,
title = {The RoyalFlush System of Speech Recognition for M2MeT Challenge},
author = {Shuaishuai Ye and Peiyao Wang and Shunfei Chen and Xinhui Hu and Xinkang Xu},
journal= {arXiv preprint arXiv:2202.01614},
year = {2022}
}