中文

基于深度学习的汉语语音障碍自动分类

声音 2022-07-07 v4 机器学习 音频与语音处理

摘要

本文描述了一个利用计算机分析声学数据以辅助诊断和分类儿童语音障碍(SSDs)的系统。分析集中于识别和分类四种不同类型的汉语语音障碍。该研究收集并生成了一个语音语料库,包含来自90名3至6岁具有正常或病理性构音特征儿童的2540个塞音化、后移、尾辅音省略过程(FCDP)和塞擦音化样本。每段录音均附有两名言语语言病理学家(SLPs)的详细诊断标注。语音样本的分类使用三种成熟的用于图像分类的神经网络模型完成。特征图由从语音信号中提取的三组梅尔频率倒谱系数(MFCC)参数创建,并聚合成三维数据结构作为模型输入。我们采用六种数据增强技术来扩充可用数据集,同时避免过拟合。实验考察了四类不同汉语短语和汉字的可用性。使用不同数据子集的实验证明了该系统准确检测所分析发音障碍的能力。使用单个汉语短语的最佳多类分类准确率达到74.4%。

关键词

引用

@article{arxiv.2205.11748,
  title  = {Deep Learning-based automated classification of Chinese Speech Sound Disorders},
  author = {Yao-Ming Kuo and Shanq-Jang Ruan and Yu-Chin Chen and Ya-Wen Tu},
  journal= {arXiv preprint arXiv:2205.11748},
  year   = {2022}
}

备注

Children 2022