StutterZero 与 StutterFormer:用于口吃转录与纠正的端到端语音转换
音频与语音处理
2025-11-06 v2 人工智能
计算与语言
摘要
全球有超过 7000 万人经历口吃,然而大多数自动语音系统会误解不流畅的话语或无法准确转录它们。现有的口吃纠正方法依赖于手工特征提取或多阶段自动语音识别(ASR)和文本转语音(TTS)流水线,这些方法将转录与音频重建分离,往往会放大失真。本工作引入了 StutterZero 和 StutterFormer,这是首批直接将口吃语音转换为流畅语音并同时预测其转录的端到端波形到波形模型。StutterZero 采用带有注意力机制的卷积双向 LSTM 编码器-解码器,而 StutterFormer 集成了带有共享声学-语言学表示的双流 Transformer。两种架构均在由 SEP-28K 和 LibriStutter 语料库合成的配对口吃-流畅数据上进行训练,并在 FluencyBank 数据集中未见过的说话人上进行评估。在所有基准测试中,与领先的 Whisper-Medium 模型相比,StutterZero 的词错误率(WER)降低了 24%,语义相似度(BERTScore)提升了 31%。StutterFormer 取得了更好的结果,WER 降低了 28%,BERTScore 提升了 34%。结果验证了直接端到端口吃到流畅语音转换的可行性,为包容性人机交互、言语治疗以及面向无障碍的 AI 系统提供了新机遇。
引用
@article{arxiv.2510.18938,
title = {StutterZero and StutterFormer: End-to-End Speech Conversion for Stuttering Transcription and Correction},
author = {Qianheng Xu},
journal= {arXiv preprint arXiv:2510.18938},
year = {2025}
}
备注
13 pages, 5 figures