儿童语音识别训练范式、数据组成与模型规模的基准测试
机器学习
2025-08-25 v1
摘要
尽管 ASR 取得了进展,儿童语音识别仍面临声学变异性大、标注数据有限等挑战。虽然常见做法是将成人 ASR 模型在儿童语音上微调,但与平铺起始训练的比较仍不足。我们在多个数据集上比较平铺起始训练,涉及 SSL 表示(WavLM、XEUS)和解码器架构。结果表明,SSL 表示偏向成人语音,儿童语音上的平铺起始训练可缓解此偏差。我们还分析模型规模,发现性能在 1B 参数时仍稳定提升,之后则平台化。此外,年龄相关的 ASR 与说话人验证分析凸显了诸如 Whisper 等专有模型的局限,强调开放数据的模型对于可靠的儿童语音研究至关重要。所有研究均在 ESPnet 上进行,本次公开基准为稳健儿童语音处理提供了训练策略的洞见。
引用
@article{arxiv.2508.16576,
title = {Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet},
author = {Anyu Ying and Natarajan Balaji Shankar and Chyi-Jiunn Lin and Mohan Shi and Pu Wang and Hye-jin Shim and Siddhant Arora and Hugo Van hamme and Abeer Alwan and Shinji Watanabe},
journal= {arXiv preprint arXiv:2508.16576},
year = {2025}
}
备注
5 pages, 3 figures, presented at WOCCI 2025 (Workshop on Child Computer Interaction), satellite workshop of Interspeech 2025