中文

关于使用 UA-Speech 与 TORGO 数据库验证自动构音障碍语音分类方法

音频与语音处理 2022-11-17 v1

摘要

尽管提供给研究界的 UA-Speech 和 TORGO 正常与构音障碍语音数据库旨在开发鲁棒的自动语音识别系统,它们也被用于验证大量自动构音障碍语音分类方法。此类方法通常依赖于一个基本假设,即正常与构音障碍说话人的录音是在相同无噪环境和使用相同录音设置下采集的。本文中,我们表明该假设在 UA-Speech 和 TORGO 数据库上不成立。利用语音活动检测提取语音与非语音段,我们表明大多数最先进的构音障碍分类方法在使用这些数据库的非语音段时,达到与使用语音段时相同或显著更好的性能。这些结果表明,在此类数据库上训练和验证的方法可能学习到的是录音环境或设置的特征,而非构音障碍语音的特征。我们希望这些结果能提高研究界在开发和评估自动构音障碍分类方法时对录音质量重要性的认识。

关键词

引用

@article{arxiv.2211.08833,
  title  = {On using the UA-Speech and TORGO databases to validate automatic dysarthric speech classification approaches},
  author = {Guilherme Schu and Parvaneh Janbakhshi and Ina Kodrasi},
  journal= {arXiv preprint arXiv:2211.08833},
  year   = {2022}
}

备注

Submitted to ICASSP 2023