利用基于成对距离的卷积神经网络进行构音障碍言语自动检测
音频与语音处理
2021-06-01 v2
摘要
构音障碍言语自动检测可提供可靠且具成本效益的计算机辅助工具,以协助构音障碍的临床诊断与管理。本文提出一种新颖的基于成对距离矩阵并使用卷积神经网络(CNNs)分析的构音障碍言语自动检测方法。我们通过发音后验表示语句,并考虑成对的音素平衡表示,其中一个来自健康说话人(即参考表示),另一个来自测试说话人(即测试表示)。给定此类参考与测试表示对,首先使用特征提取前端提取特征,计算帧级距离矩阵,并将所得距离矩阵作为图像输入基于CNN的二分类器。特征提取、距离矩阵计算与基于CNN的分类器在端到端框架中联合优化。在两个包含不同语言与病理的健康与构音障碍说话人数据库上的实验结果表明,所提方法取得了较高的构音障碍言语检测性能,优于其他基于CNN的基线方法。
引用
@article{arxiv.2011.07545,
title = {Automatic dysarthric speech detection exploiting pairwise distance-based convolutional neural networks},
author = {P. Janbakhshi and I. Kodrasi and H. Bourlard},
journal= {arXiv preprint arXiv:2011.07545},
year = {2021}
}
备注
accepted at ICASSP 2021