中文

面向无序语音的单一语音识别模型

音频与语音处理 2025-12-22 v2

摘要

本研究考察了将约 1000 小时的无序语音录音数据集整合到接近最先进语音识别基线系统微调中的影响。与人们的预期相反,尽管该数据仅占语音识别系统训练数据的不到 1%,我们发现无序语音识别准确率显著提升。具体而言,我们在提示语音上观察到 33% 的改进,在新收集的自发、对话无序语音数据集上观察到 26% 的改进。重要的是,在标准语音识别基准测试上没有显著的性能下降。进一步地,我们观察到所提出的调优策略帮助缩小了基线系统与个人化模型之间的差距,缩小了 64%。鉴于我们发现的显著益处,本实验表明,从公平性角度出发,在训练配方中纳入少量高质量无序语音数据是一个容易实施的步骤,可使语音技术更 accessible 给拥有语音障碍的用户。

关键词

引用

@article{arxiv.2412.19315,
  title  = {Towards a Single ASR Model That Generalizes to Disordered Speech},
  author = {Jimmy Tobin and Katrin Tomanek and Subhashini Venugopalan},
  journal= {arXiv preprint arXiv:2412.19315},
  year   = {2025}
}

备注

Accepted at ICASSP 2025