中文

面向南非呼叫中心音频的多风格训练

声音 2022-02-16 v1 人机交互 机器学习 音频与语音处理

摘要

不匹配数据是自动语音识别(ASR)系统面临的一项挑战性问题。解决不匹配数据最常用的技术之一是多风格训练(MTR),这是一种数据增强形式,试图将训练数据转换为更能代表测试数据的形式,并学习适用于不同条件的鲁棒表示。若测试条件未知,该任务会非常困难。我们探讨了在深度神经网络隐马尔可夫模型(DNN-HMM)ASR 系统中,当测试条件与训练条件不同时,不同 MTR 风格对系统性能的影响。利用 LibriSpeech 语料库构建受控环境,以隔离不同 MTR 风格对最终系统性能的影响。我们在包含噪声、WAV49 编码音频的南非呼叫中心数据集上评估了我们的发现。

关键词

引用

@article{arxiv.2202.07219,
  title  = {Multi-style Training for South African Call Centre Audio},
  author = {Walter Heymans and Marelie H. Davel and Charl van Heerden},
  journal= {arXiv preprint arXiv:2202.07219},
  year   = {2022}
}

备注

9 pages, 8 tables, Southern African Conference for Artificial Intelligence Research 2021, Part of the Communications in Computer and Information Science book series (CCIS, volume 1551, pp 111-124), Springer