中文

面向受语音系统受损患者的语音质量评估方法——基于ASR表示的多特征开发

声音 2024-08-23 v1 人工智能 音频与语音处理

摘要

深度学习在临床语音处理领域的潜力巨大,但受限于临床数据样本数量不足和样本不平衡的挑战仍然突出。本文通过展示利用自动语音识别和自监督学习表示(pre-trained on extensive datasets of normal speech)的方法,旨在估计受语音系统受损患者的语音质量。实验涉及覆盖英语中各种语音系统损伤原因的 PVQD 数据集,以及侧重于运动性病患者的日语数据集,其患者在接受亚核深部脑刺激 (STN-DBS) 手术前后进行测试。PVQD 数据集的结果显示,对预测等级 (Grade)、呼吸 (Breathy) 和无力 (Asthenic) 指标的相关性显著(PCC > 0.8),均方根误差 (MSE) 极低(< 0.5)。同时,在 STN-DBS 语境下预测患者语音质量方面也取得了进展。

关键词

引用

@article{arxiv.2408.12279,
  title  = {Developing vocal system impaired patient-aimed voice quality assessment approach using ASR representation-included multiple features},
  author = {Shaoxiang Dang and Tetsuya Matsumoto and Yoshinori Takeuchi and Takashi Tsuboi and Yasuhiro Tanaka and Daisuke Nakatsubo and Satoshi Maesawa and Ryuta Saito and Masahisa Katsuno and Hiroaki Kudo},
  journal= {arXiv preprint arXiv:2408.12279},
  year   = {2024}
}

备注

Accepted by Interspeech 2024