模拟构音障碍语音用于临床语音应用中的训练数据增强
音频与语音处理
2018-04-30 v1
摘要
训练语音应用的机器学习算法需要大规模带标签的训练数据集。这对于临床应用而言存在问题,因为出于隐私顾虑或缺乏获取途径,获取此类数据的成本过高。因此,临床语音应用通常使用仅有数十名说话人的小规模数据集开发。在本文中,我们提出一种通过对抗训练将健康语音转换为构音障碍语音来模拟临床应用训练数据的方法。我们使用客观和主观标准评估我们方法的有效性。我们将转换后的样本呈现给五位经验丰富的言语语言病理学家(SLPs),并要求他们将样本识别为健康或构音障碍。结果显示,SLPs在65%的情况下将转换后的语音识别为构音障碍。在一项初步分类实验中,我们表明通过使用模拟语音样本来平衡现有数据集,数据增强后的分类准确率提高了约10%。
引用
@article{arxiv.1804.10325,
title = {Simulating dysarthric speech for training data augmentation in clinical speech applications},
author = {Yishan Jiao and Ming Tu and Visar Berisha and Julie Liss},
journal= {arXiv preprint arXiv:1804.10325},
year = {2018}
}
备注
Will appear in Proc. of ICASSP 2018