中文

用于低资源端到端口音语音识别的多遍训练与跨信息融合

声音 2023-06-21 v1 计算与语言 音频与语音处理 信号处理

摘要

低资源口音语音识别是当前ASR技术在实际应用中面临的重要挑战之一。在本研究中,我们提出一种基于Conformer的架构,称为Aformer,以利用来自大规模无口音和有限口音训练数据的声学信息。具体而言,Aformer中设计了一个通用编码器和一个口音编码器来提取互补的声学信息。此外,我们提出以多遍方式训练Aformer,并研究了三种跨信息融合方法,以有效结合来自通用编码器和口音编码器的信息。所有实验在口音英语和普通话ASR任务上进行。结果表明,在六个域内和域外口音测试集上,我们提出的方法相较强大的Conformer基线取得了相对10.2%至24.5%的词/字符错误率降低。

关键词

引用

@article{arxiv.2306.11309,
  title  = {Multi-pass Training and Cross-information Fusion for Low-resource End-to-end Accented Speech Recognition},
  author = {Xuefei Wang and Yanhua Long and Yijie Li and Haoran Wei},
  journal= {arXiv preprint arXiv:2306.11309},
  year   = {2023}
}