中文

面向粤语失语症患者的端到端自动语音评估方法

音频与语音处理 2019-04-02 v1

摘要

传统的病理语音自动评估通常遵循两个主要步骤:(1) 提取病理特异性特征;(2) 对提取的特征进行分类或回归。鉴于语音和语言障碍的多样性,特征设计从来不是一项直截了当的任务,然而它对评估性能却最为关键。本文提出一种面向粤语失语症患者 (PWA) 的端到端自动语音评估方法。该评估被构建为二分类任务,以区分主观评估得分高的 PWA 与得分低的 PWA。采用序列到单的带门控循环单元循环神经网络 (GRU-RNN) 和卷积神经网络 (CNN) 模型来实现从基础语音特征到分类结果的端到端映射。用于评估的病理特异性特征可由神经网络模型隐式学习。利用类激活映射 (CAM) 方法可视化这些特征如何贡献于评估结果。我们的实验结果表明,在该分类任务中端到端方法优于传统两步方法,并证实 CNN 模型能够学习与人为设计特征相似的损伤相关特征。实验结果还表明,在该特定任务中 CNN 模型表现优于序列到单 GRU-RNN 模型。

关键词

引用

@article{arxiv.1904.00361,
  title  = {An End-to-End Approach to Automatic Speech Assessment for Cantonese-speaking People with Aphasia},
  author = {Ying Qin and Yuzhong Wu and Tan Lee and Anthony Pak Hin Kong},
  journal= {arXiv preprint arXiv:1904.00361},
  year   = {2019}
}