基于小规模失调语音数据集训练的个性化自动语音识别
音频与语音处理
2021-10-12 v1 计算与语言
机器学习
声音
摘要
本研究探讨了利用少量说话人自适应数据识别失调语音的个性化自动语音识别(ASR)的性能。我们为195名患有不同类型与严重程度语音障碍的个体训练了个性化模型,其训练集规模从不足1分钟到18-20分钟语音数据不等。我们选取了词错误率(WER)阈值,以确定在不同应用场景中达到目标WER的成功百分比(即达到目标WER的个性化模型所占百分比)。对于家庭自动化场景,79%的说话人在使用18-20分钟语音时达到了目标WER;而即便仅使用3-4分钟语音,也有63%的说话人达到了目标WER。进一步评估发现,在包含对话式及域外无提示短语的测试集上亦有类似改进。我们的结果表明,仅需几分钟录音,失调语音个体便可受益于个性化ASR。
引用
@article{arxiv.2110.04612,
title = {Personalized Automatic Speech Recognition Trained on Small Disordered Speech Datasets},
author = {Jimmy Tobin and Katrin Tomanek},
journal= {arXiv preprint arXiv:2110.04612},
year = {2021}
}
备注
Submitted to ICASSP 2022