使用 Kaldi 进行奥地利德语会话语音的自动语音识别
计算与语言
2023-01-18 v1 声音
音频与语音处理
摘要
随着对话系统变得愈发交互化与社会化,会话语音的准确自动语音识别(ASR)也日益重要。焦点由此从简短、自发、任务导向的对话,转向随意面对面交谈的高得多的复杂性。然而,此类对话的采集与标注耗时,且该特定说话风格的数据稀疏。本文给出以朗读与会话奥地利德语为目标的 ASR 实验。为应对会话德语资源有限,同时说话人发音特征差异大的问题,我们改进了基于 Kaldi 的 ASR 系统:引入(大型)基于知识的发音词典,同时探索不同基于数据的方法以限制每个词条发音变体数。我们在奥地利德语朗读语音上取得最佳 WER 0.4%,在会话语音上取得最佳平均 WER 48.5%。我们发现,使用我们最佳发音词典可取得与将语言模型所用数据规模提升约 360% 至 760% 相仿的高性能。我们的发现表明,对于低资源场景——尽管语音技术总体趋势为仅用基于数据的方法——基于知识的方法是一种成功且高效的途径。
引用
@article{arxiv.2301.06475,
title = {Using Kaldi for Automatic Speech Recognition of Conversational Austrian German},
author = {Julian Linke and Saskia Wepner and Gernot Kubin and Barbara Schuppler},
journal= {arXiv preprint arXiv:2301.06475},
year = {2023}
}
备注
10 pages, 2 figures, 4 tables