面向不流畅语音的语音助手系统分析与调优
音频与语音处理
2021-06-23 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
声音
摘要
不流畅及语音发音差异会严重降低语音识别性能,对于许多中度至重度言语障碍者而言,语音操作系统无法工作。当前的语音识别系统主要使用流畅说话者数据训练,因此难以泛化到具有声音或词语重复、声音延长或可听阻塞等不流畅的语音。本工作的重点是对口吃个体上的消费级语音识别系统进行定量分析,以及面向常见语音助手任务(如“天气如何?”)提升性能的面向生产的方法。在基线上,该系统引入了大量插入与替换错误,导致流畅性障碍者的预期语音词错率(isWER)绝对恶化13.64%。我们展示,通过简单调优现有混合语音识别系统中的解码参数,可使流畅性障碍者的isWER相对提升24%。对这些参数的调优转化为相较于默认设置,在18名涵盖所有口吃严重程度的受试者上领域识别相对提升3.6%、意图识别相对提升1.7%。
引用
@article{arxiv.2106.11759,
title = {Analysis and Tuning of a Voice Assistant System for Dysfluent Speech},
author = {Vikramjit Mitra and Zifang Huang and Colin Lea and Lauren Tooley and Sarah Wu and Darren Botten and Ashwini Palekar and Shrinath Thelapurath and Panayiotis Georgiou and Sachin Kajarekar and Jefferey Bigham},
journal= {arXiv preprint arXiv:2106.11759},
year = {2021}
}
备注
5 pages, 1 page reference, 2 figures