基于监督式与自监督式语音基础模型对儿童ASR的基准测试
音频与语音处理
2024-06-18 v1 计算与语言
声音
摘要
语音基础模型(SFMs)在监督式(如Whisper)或自监督式系统(如WavLM)中已取得各种语音任务的领先成绩。然而,SFMs用于儿童语音识别(ASR)的性能尚未系统研究。此外,目前没有针对儿童ASR的基准测试,使得新想法的比较困难。本文我们基于各种SFMs(Whisper、Wav2vec2.0、HuBERT和WavLM),启动并提出了针对儿童语音数据库的全面基准测试。此外,我们调查了通过比较各种数据增强和参数高效微调(PEFT)方法来进行微调的策略。我们观察到这些方法在模型规模增大时行为不同。例如,PEFT在大型模型中与完整微调相当,但在小型模型中表现更差。为稳定使用增强数据的微调,我们提出了一种扰动不变微调(PIF)损失作为正则化。
引用
@article{arxiv.2406.10507,
title = {Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models},
author = {Ruchao Fan and Natarajan Balaji Shankar and Abeer Alwan},
journal= {arXiv preprint arXiv:2406.10507},
year = {2024}
}
备注
To appear in Interspeech 2024