分层自监督特征能否提升儿童语音零样本语音识别性能?
音频与语音处理
2025-09-01 v1 人工智能
机器学习
声音
信号处理
摘要
自动语音识别(ASR)系统常常难以准确处理儿童语音 due to its distinct and highly variable acoustic and linguistic characteristics。虽然近期发展自监督学习(SSL)模型大大增强了成年人语音的转录,但准确转录儿童语音仍是重大挑战。本研究检验从最新SOTA SSL预训练模型中提取的分层特征——具体为 Wav2Vec2、HuBERT、Data2Vec 和 WavLM——在儿童语音零样本ASR情景下的有效性。对这些模型提取的特征进行了详细分析,通过Kaldi工具包将其集成到简化的基于DNN的ASR系统中。分析确定了最有效的层以增强ASR在儿童语音上的表现于零样本情景,其中WSJCAM0 成年语音用于训练,PFSTAR 儿童语音用于测试。实验结果表明,Wav2Vec2模型的第22层实现了5.15%的词错误率(WER),相对于直接使用Wav2Vec2进行零样本解码(WER为10.65%)实现了51.64%的相对改进。此外,按年龄组分析显示性能随年龄增长而一致提升,且即使在较年轻的年龄组中也观察到显著 gains 使用SSL特征。进一步在CMU Kids数据集上的实验确认了类似趋势,凸显了该方法的通用性。
引用
@article{arxiv.2508.21225,
title = {Can Layer-wise SSL Features Improve Zero-Shot ASR Performance for Children's Speech?},
author = {Abhijit Sinha and Hemant Kumar Kathania and Sudarsana Reddy Kadiri and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2508.21225},
year = {2025}
}
备注
Accepted