通过增强儿童语音提升儿童语音识别
计算与语言
2025-01-09 v1 声音
音频与语音处理
摘要
领先的自动语音识别(ASR)对儿童语音显示出次优的性能。儿童语音的稀缺性限制了儿童语音识别(CSR)的开发。因此,我们研究了从现有儿童说话者(通过单语种)和额外(新)儿童说话者(通过跨语种[Dutch-to-German])进行儿童语音转换(VC)。结果表明,跨语种儿童语音转换显著改善了儿童 ASR 性能。实验考察了儿童语音转换生成数据数量对微调(FT) ASR 模型的影响,结果显示对于我们的 FT-Conformer 模型和 FT-Whisper 模型,使用两倍增强可将 WER 降低约 3% 绝对值;对于从头训练的模型,使用六倍增强可提升 3.6% 绝对 WER。此外,使用少量“高质量”VC 生成数据即可实现与最佳 FT 模型相似的效果。
引用
@article{arxiv.2406.10284,
title = {Improving child speech recognition with augmented child-like speech},
author = {Yuanyuan Zhang and Zhengjun Yue and Tanvina Patel and Odette Scharenborg},
journal= {arXiv preprint arXiv:2406.10284},
year = {2025}
}
备注
5 pages, 1 figure Accepted to INTERSPEECH 2024