用于低资源端到端口音语音识别的多遍训练与跨信息融合
声音
2023-06-21 v1 计算与语言
音频与语音处理
信号处理
摘要
低资源口音语音识别是当前ASR技术在实际应用中面临的重要挑战之一。在本研究中,我们提出一种基于Conformer的架构,称为Aformer,以利用来自大规模无口音和有限口音训练数据的声学信息。具体而言,Aformer中设计了一个通用编码器和一个口音编码器来提取互补的声学信息。此外,我们提出以多遍方式训练Aformer,并研究了三种跨信息融合方法,以有效结合来自通用编码器和口音编码器的信息。所有实验在口音英语和普通话ASR任务上进行。结果表明,在六个域内和域外口音测试集上,我们提出的方法相较强大的Conformer基线取得了相对10.2%至24.5%的词/字符错误率降低。
引用
@article{arxiv.2306.11309,
title = {Multi-pass Training and Cross-information Fusion for Low-resource End-to-end Accented Speech Recognition},
author = {Xuefei Wang and Yanhua Long and Yijie Li and Haoran Wei},
journal= {arXiv preprint arXiv:2306.11309},
year = {2023}
}