中文

利用LLM处理口吃语音:桥接识别与事件检测的统一架构

声音 2025-05-29 v1 音频与语音处理

摘要

自动语音识别(ASR)在口吃语音场景中的性能瓶颈限制了其在言语康复等领域的适用性。本文提出了一种由LLM驱动的ASR-SED多任务学习框架,联合优化ASR和口吃事件检测(SED)任务。我们提出了一种动态交互机制,其中ASR分支利用CTC生成的软提示来辅助LLM上下文建模,而SED分支输出口吃嵌入以增强LLM对口吃语音的理解。我们引入对比学习以增强口吃声学特征的判别能力,并应用Focal Loss以缓解口吃事件类别中的长尾分布。在AS-70中文口吃数据集上的评估表明,我们的框架将ASR字符错误率(CER)降低至5.45%(相对降低37.71%),并实现了73.63%的平均SED F1分数(相对提升46.58%)。

关键词

引用

@article{arxiv.2505.22005,
  title  = {Leveraging LLM for Stuttering Speech: A Unified Architecture Bridging Recognition and Event Detection},
  author = {Shangkun Huang and Jing Deng and Jintao Kang and Rong Zheng},
  journal= {arXiv preprint arXiv:2505.22005},
  year   = {2025}
}

备注

Accepted to Interspeech 2025