面向口吃语音的 ASR 微调:个性化方法与泛化方法的对比
声音
2025-08-22 v2 音频与语音处理
摘要
口吃——表现为诸如阻塞、延长和重复等非自愿的不流畅性——常被自动语音识别(ASR)系统误解,导致词错误率升高,使口吃者难以使用语音驱动技术。不同说话人和语境下不流畅性的多变性进一步使 ASR 训练复杂化,加之口吃语音的标注数据有限。在本文中,我们研究了针对口吃语音的 ASR 微调,比较了泛化模型(在多个说话人上训练)与针对个人语音特征定制的个性化模型。利用包括虚拟助手和视频访谈在内的多种语音 AI 场景,我们评估了个性化对转录准确性的影响。我们的研究结果表明,个性化 ASR 显著降低了词错误率,尤其是在自发语音中,突显了定制模型在构建更具包容性的语音技术方面的潜力。
引用
@article{arxiv.2506.00853,
title = {Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches},
author = {Dena Mujtaba and Nihar Mahapatra},
journal= {arXiv preprint arXiv:2506.00853},
year = {2025}
}
备注
Accepted to Interspeech 2025