中文

语音不流畅检测中合成数据生成的分析与评估

音频与语音处理 2025-06-24 v2 人工智能 声音

摘要

语音不流畅检测对临床诊断和语言评估至关重要,但现有方法受限于高质量标注数据的稀缺。尽管 TTS 模型的最新进展使得合成不流畅语音生成成为可能,但现有合成数据集存在韵律不自然和上下文多样性有限的问题。为解决这些局限性,我们提出了 LLM-Dys——一个利用 LLM 增强不流畅模拟的、最全面的不流畅语音语料库。该数据集涵盖了跨越词和音素两个层级的 11 类不流畅类别。在此资源的基础上,我们改进了一个端到端不流畅检测框架。实验验证表明其达到了 state-of-the-art 性能。所有数据、模型和代码已在 https://github.com/Berkeley-Speech-Group/LLM-Dys 开源。

关键词

引用

@article{arxiv.2505.22029,
  title  = {Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection},
  author = {Jinming Zhang and Xuanru Zhou and Jiachen Lian and Shuhe Li and William Li and Zoe Ezzes and Rian Bogley and Lisa Wauters and Zachary Miller and Jet Vonk and Brittany Morin and Maria Gorno-Tempini and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2505.22029},
  year   = {2025}
}

备注

Accepted by Interspeech 2025