中文

多阶段跨语言声学模型自适应用于真实世界应用中的鲁棒语音识别——以德语口述历史访谈为例

音频与语音处理 2022-01-19 v1 计算与语言

摘要

尽管近期自动语音识别系统在使用大量充分、高质量标注语音数据训练时取得了显著性能,但对于与训练数据所代表条件偏差较大的领域任务,相同系统往往只能获得不尽人意的结果。对于许多真实世界应用,缺乏可直接用于训练鲁棒语音识别系统的充足数据。为解决此问题,我们提出并研究了一种以跨语言、多阶段方式对目标领域进行鲁棒声学模型自适应的方法。我们的方法能够利用来自同语言及其他语言其他领域的大规模训练数据。我们使用具有挑战性的德语口述历史访谈任务评估该方法,与仅在目标领域从头训练的模型相比,词错误率相对降低超过30%,与基于1000小时同语言域外训练数据鲁棒训练的模型相比相对降低6-7%。

关键词

引用

@article{arxiv.2005.12562,
  title  = {Multi-Staged Cross-Lingual Acoustic Model Adaption for Robust Speech Recognition in Real-World Applications -- A Case Study on German Oral History Interviews},
  author = {Michael Gref and Oliver Walter and Christoph Schmidt and Sven Behnke and Joachim Köhler},
  journal= {arXiv preprint arXiv:2005.12562},
  year   = {2022}
}

备注

Published version of the paper can be accessed via https://www.aclweb.org/anthology/2020.lrec-1.780