用于词级口吃语音检测的自监督语音模型
音频与语音处理
2024-09-18 v1 人工智能
计算与语言
声音
摘要
口吃的临床诊断需要由有执照的言语语言病理学家进行评估。然而,这一过程耗时,且需要临床医生在口吃和言语流畅性障碍方面具备训练与经验。遗憾的是,只有小部分言语语言病理学家表示愿意处理口吃患者,这不足以满足全球 8000 万口吃者的需求。开发用于检测口吃语音的机器学习模型将实现口吃的普遍自动化筛查,使言语病理学家能够识别并随访最有可能被诊断为口吃性言语障碍的患者。该领域以往的研究主要集中在话语级检测上,这在以口吃词级标注为常态的临床环境中是不够的。在本研究中,我们整理了一个带有词级标注的口吃语音数据集,并引入了利用自监督语音模型的词级口吃语音检测模型。我们的评估表明,我们的模型在词级口吃语音检测方面超越了以往的方法。此外,我们对方法进行了广泛的消融分析,深入探讨了将自监督语音模型适配于口吃语音检测的最重要方面。
引用
@article{arxiv.2409.10704,
title = {Self-supervised Speech Models for Word-Level Stuttered Speech Detection},
author = {Yi-Jen Shih and Zoi Gkalitsiou and Alexandros G. Dimakis and David Harwath},
journal= {arXiv preprint arXiv:2409.10704},
year = {2024}
}
备注
Accepted by IEEE SLT 2024