基于数据中心方法与混合 HMM 及 CNN-TDNN 的噪声电话环境下语码转换乌尔都语语音识别
计算与语言
2023-07-25 v1 声音
音频与语音处理
摘要
呼叫中心拥有海量音频数据,可用于获取有价值的商业洞察,而电话通话的转写是一项人工繁琐的任务。高效的自动语音识别(ASR)系统可准确转写这些通话,便于通过呼叫历史按特定语境与内容检索,从而实现自动呼叫监控,并通过关键词搜索与情感分析提升服务质量(QoS)。呼叫中心 ASR 需具备更高鲁棒性,因为电话环境通常含噪。此外,许多低资源语言濒临消失,可借助自动语音识别技术得以保存。乌尔都语是全球第 大通用语言,全球有 231,295,440 使用者,但在 ASR 中仍是资源受限语言。地区呼叫中心对话以本地语言进行,夹杂英文数字与技术术语,通常引发“语码转换”问题。因此,本文描述了一种在噪声呼叫中心环境下,使用链式混合 HMM 与 CNN-TDNN 针对语码转换乌尔都语的、资源高效的自动语音识别/语音转文本系统实现框架。采用混合 HMM-DNN 方法使我们得以在较少标注数据下利用神经网络优势。CNN 与 TDNN 结合因 CNN 额外的频率维度可从含噪语音捕获额外信息,在噪声环境中表现更优,从而提升准确率。我们从多个开放源收集数据,并在分析其来自乌尔都语及其他语言(主要为英语)的通用语境与内容后标注了部分未标注数据,从而在孤立词或数字以及连续自发语音的噪声与干净环境下均取得了 5.2% 的词错率(WER)。
引用
@article{arxiv.2307.12759,
title = {Code-Switched Urdu ASR for Noisy Telephonic Environment using Data Centric Approach with Hybrid HMM and CNN-TDNN},
author = {Muhammad Danyal Khan and Raheem Ali and Arshad Aziz},
journal= {arXiv preprint arXiv:2307.12759},
year = {2023}
}
备注
32 pages, 19 figures, 2 tables, preprint