中文

儿童语音ASR错误的因果分析:量化生理、认知及外部因素的影响

音频与语音处理 2025-02-13 v1

摘要

近年来,儿童自动语音识别(ASR)系统的日益普及推动了针对儿童语音模型准确性的研究。当前方法要么直接使用开源语音基础模型(SFM),要么使用儿童语音数据对其进行微调。这些SFM,无论是开源的还是针对儿童微调的,与成人语音相比,通常表现出更高的词错误率(WER)。然而,目前缺乏对SFM性能下降原因的系统性分析。理解并解决这种性能差异背后的原因,对于提高儿童语音SFM的准确性至关重要。我们的研究通过探究准确性下降的原因以及儿童语音中WER的主要贡献因素来填补这一空白。在研究的第一部分,我们在两个儿童语音语料库上,对不同年龄组进行了两种自监督SFM(Wav2Vec2.0和Hubert)和两种弱监督SFM(Whisper和MMS)的全面基准测试,为第二部分的因果推断分析建立了原始数据。在研究的第二部分,我们使用因果推断分析了生理因素(年龄、性别)、认知因素(发音能力)和外部因素(词汇难度、背景噪声和词数)对儿童语音SFM准确性的影响。结果表明,生理因素(年龄)和特定的外部因素(音频中的词数)对准确性的影响最大,其次是背景噪声和发音能力。在儿童语音上微调SFM会降低对生理和认知因素的敏感性,而对音频中词数的敏感性仍然存在。

关键词

引用

@article{arxiv.2502.08587,
  title  = {Causal Analysis of ASR Errors for Children: Quantifying the Impact of Physiological, Cognitive, and Extrinsic Factors},
  author = {Vishwanath Pratap Singh and Md. Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2502.08587},
  year   = {2025}
}

备注

Submitted to Computer Speech & Language