中文

CHSER:儿童ASR生成式语音纠错数据集与案例研究

音频与语音处理 2025-05-27 v1

摘要

自动语音识别(ASR)系统由于儿童语音独特的声学和语言变异性以及儿童语音数据集的有限可用性,在处理儿童语音时面临困难,导致较高的转录错误率。虽然ASR纠错(AEC)方法已改善了成人语音转录,但其在儿童语音上的有效性仍 largely unexplored。为解决这一问题,我们引入了CHSER,一个面向儿童语音的生成式语音纠错(GenSEC)数据集,包含20万个假设-转录对,涵盖多样化的年龄段和说话风格。结果表明,在零样本设置下,基于CHSER数据集进行微调可实现高达28.5%的相对WER降低,在应用于微调后的ASR系统时可实现13.3%的降低。此外,我们的错误分析显示,虽然GenSEC改善了替换和删除错误,但在插入和儿童特有的不流畅性方面存在困难。这些发现突显了GenSEC在改善儿童ASR方面的潜力。

关键词

引用

@article{arxiv.2505.18463,
  title  = {CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR},
  author = {Natarajan Balaji Shankar and Zilai Wang and Kaiyuan Zhang and Mohan Shi and Abeer Alwan},
  journal= {arXiv preprint arXiv:2505.18463},
  year   = {2025}
}

备注

Accepted in Interspeech 2025