面向南非呼叫中心音频的多风格训练
声音
2022-02-16 v1 人机交互
机器学习
音频与语音处理
摘要
不匹配数据是自动语音识别(ASR)系统面临的一项挑战性问题。解决不匹配数据最常用的技术之一是多风格训练(MTR),这是一种数据增强形式,试图将训练数据转换为更能代表测试数据的形式,并学习适用于不同条件的鲁棒表示。若测试条件未知,该任务会非常困难。我们探讨了在深度神经网络隐马尔可夫模型(DNN-HMM)ASR 系统中,当测试条件与训练条件不同时,不同 MTR 风格对系统性能的影响。利用 LibriSpeech 语料库构建受控环境,以隔离不同 MTR 风格对最终系统性能的影响。我们在包含噪声、WAV49 编码音频的南非呼叫中心数据集上评估了我们的发现。
引用
@article{arxiv.2202.07219,
title = {Multi-style Training for South African Call Centre Audio},
author = {Walter Heymans and Marelie H. Davel and Charl van Heerden},
journal= {arXiv preprint arXiv:2202.07219},
year = {2022}
}
备注
9 pages, 8 tables, Southern African Conference for Artificial Intelligence Research 2021, Part of the Communications in Computer and Information Science book series (CCIS, volume 1551, pp 111-124), Springer