中文

唇腭裂语音自动语音识别的公平性研究

音频与语音处理 2025-05-07 v1

摘要

由于结构异常,唇腭裂(CLP)个体产生的语音通常高度鼻音化和气息化,导致共振峰结构发生变化,从而影响自动语音识别(ASR)的性能和公平性。本研究假设公开可用的ASR系统对CLP语音表现出降低的公平性,并通过实验证实了这一点。尽管存在共振峰扰动,轻度和中度CLP语音仍保留了一些与正常语音的频谱-时间对齐,这为通过数据增强策略提升公平性提供了动机。本研究系统地探索了在不同严重程度下用正常语音增强CLP语音的方法,并评估了其对ASR公平性的影响。在AIISH和NMCPC数据集上测试了三种ASR模型:GMM-HMM、Whisper和XLS-R。结果表明,使用正常语音训练并在混合数据上测试可以改善词错误率(WER)。值得注意的是,WER分别从22.64%降至18.76%(GMM-HMM,AIISH)和从28.45%降至18.89%(Whisper,NMCPC)。GMM-HMM在AIISH上的优越性能可能源于其对卡纳达语儿童语音的适用性,这对XLS-R和Whisper等基础模型构成了挑战。为评估公平性,我们引入了一个公平性分数,结果显示通过数据增强,公平性在AIISH上提升了17.89%,在NMCPC上提升了47.50%。

关键词

引用

@article{arxiv.2505.03697,
  title  = {Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech},
  author = {Susmita Bhattacharjee and Jagabandhu Mishra and H. S. Shekhawat and S. R. Mahadeva Prasanna},
  journal= {arXiv preprint arXiv:2505.03697},
  year   = {2025}
}

备注

Submitted to Digital Signal Processing