中文

Dysfluent WFST:零样本语音语病转录与检测框架

音频与语音处理 2025-05-27 v2 人工智能

摘要

自动检测语音语病有助于语音语言病理学家高效地转录无序语音,提升诊断和治疗计划。传统方法往往仅限于分类,提供的临床洞察不足,文本无关模型在语境相关案例中易误判语病。本工作引入Dysfluent-WFST,一个零样本解码器,同时转录音素并检测语病。不同于先前模型,Dysfluent-WFST无需额外训练,即可与WavLM等上游编码器协同工作。在模拟和真实语音数据上,Dysfluent-WFST在语音错误率和语病检测方面实现了最新水平。该方法轻量级、可解释且有效,表明在解码中显式建模语音发音行为,而非复杂的体系结构,才是提升语病处理系统关键所在。

关键词

引用

@article{arxiv.2505.16351,
  title  = {Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection},
  author = {Chenxu Guo and Jiachen Lian and Xuanru Zhou and Jinming Zhang and Shuhe Li and Zongli Ye and Hwi Joo Park and Anaisha Das and Zoe Ezzes and Jet Vonk and Brittany Morin and Rian Bogley and Lisa Wauters and Zachary Miller and Maria Gorno-Tempini and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2505.16351},
  year   = {2025}
}

备注

Accepted for Interspeech2025