中文

Gammatonegram 表示用于端到端构音障碍语音处理任务:语音识别、说话人识别与可懂度评估

音频与语音处理 2024-03-22 v2 计算与语言 声音

摘要

构音障碍是一种导致人类语音系统紊乱并降低语音质量与可懂度的障碍。由于该影响,常规语音处理系统无法在受损语音上正常工作。该障碍通常与身体残疾相关。因此,设计一个能通过接收智能家居中语音命令执行某些任务的系统是一项重要成果。本工作中,我们引入 gammatonegram 作为一种以判别性细节表示音频文件的有效方法,并将其用作卷积神经网络的输入。换言之,我们将每个语音文件转换为图像,并提出图像识别系统以对不同场景下的语音进行分类。所提 CNN 基于预训练 Alexnet 的迁移学习方法。本研究评估了所提系统在语音识别、说话人识别与可懂度评估中的效率。根据 UA 数据集上的结果,所提语音识别系统在说话人依赖模式下达到 91.29% 准确率,说话人识别系统在文本依赖模式下获得 87.74% 准确率,可懂度评估系统在二分类模式下达到 96.47% 准确率。最后,我们提出一种完全自动工作的多网络语音识别系统。该系统与二分类可懂度评估系统级联排列,该系统的输出激活各个语音识别网络之一。该架构达到 92.3% WRR 准确率。本文源代码已公开。

关键词

引用

@article{arxiv.2307.03296,
  title  = {Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment},
  author = {Aref Farhadipour and Hadi Veisi},
  journal= {arXiv preprint arXiv:2307.03296},
  year   = {2024}
}

备注

12 pages, 8 figures. Iran J Comput Sci (2024)