中文

基于Transformer的小样本构音障碍语音可懂度级别分类方法

声音 2024-06-17 v1 计算与语言 音频与语音处理

摘要

构音障碍是一种因发音困难而阻碍交流的言语障碍。检测构音障碍十分重要,原因有多方面:可用于制定治疗方案,并帮助改善人的生活质量与有效交流能力。大量文献聚焦于改进针对构音障碍语音的ASR系统。当前工作的目标是开发能够准确分类构音障碍是否存在、并通过采用Transformer模型的小样本方法利用有限数据给出可懂度级别信息的模型。本工作也旨在解决先前研究中存在的数据泄漏问题。我们的whisper-large-v2 transformer模型在包含中等可懂度级别患者的UASpeech数据集子集上训练,取得了85%的准确率、0.92的精确率、0.8的召回率、0.85的F1分数和0.91的特异度。实验结果还表明,使用‘words’数据集训练的模型优于使用‘letters’和‘digits’数据集训练的模型。此外,多分类模型取得了67%的准确率。

关键词

引用

@article{arxiv.2309.09329,
  title  = {A Few-Shot Approach to Dysarthric Speech Intelligibility Level Classification Using Transformers},
  author = {Paleti Nikhil Chowdary and Vadlapudi Sai Aravind and Gorantla V N S L Vishnu Vardhan and Menta Sai Akshay and Menta Sai Aashish and Jyothish Lal. G},
  journal= {arXiv preprint arXiv:2309.09329},
  year   = {2024}
}

备注

Paper has been presented at ICCCNT 2023 and the final version will be published in IEEE Digital Library Xplore