面向个性化儿童语音识别的测试时自适应研究
机器学习
2025-08-05 v2 计算与语言
声音
音频与语音处理
摘要
自动语音识别(ASR)模型通常由于测试时引入的数据域偏移而出现性能下降,这一挑战在儿童说话者中进一步放大。测试时自适应(TTA)方法在弥合这一领域差距方面展现出了巨大潜力。然而,使用 TTA 将 ASR 模型适应于每个儿童语音的个体差异尚未得到系统研究。在这项工作中,我们研究了两种广泛使用的 TTA 方法——SUTA 和 SGEM——在适应现成 ASR 模型及其微调版本以进行儿童语音识别方面的有效性,旨在实现测试时的持续无监督自适应。我们的研究结果表明,与未自适应的基线相比,TTA 显著提高了现成和微调 ASR 模型的性能,无论是在平均水平上还是在各个儿童说话者之间。然而,虽然 TTA 有助于适应个体差异,但在处理非语言学儿童语音时可能仍然存在局限性。
引用
@article{arxiv.2409.13095,
title = {Examining Test-Time Adaptation for Personalized Child Speech Recognition},
author = {Zhonghao Shi and Xuan Shi and Anfeng Xu and Tiantian Feng and Harshvardhan Srivastava and Shrikanth Narayanan and Maja J. Matarić},
journal= {arXiv preprint arXiv:2409.13095},
year = {2025}
}
备注
Accepted to Interspeech 2025