中文

基于监督式与自监督式语音基础模型对儿童ASR的基准测试

音频与语音处理 2024-06-18 v1 计算与语言 声音

摘要

语音基础模型(SFMs)在监督式(如Whisper)或自监督式系统(如WavLM)中已取得各种语音任务的领先成绩。然而,SFMs用于儿童语音识别(ASR)的性能尚未系统研究。此外,目前没有针对儿童ASR的基准测试,使得新想法的比较困难。本文我们基于各种SFMs(Whisper、Wav2vec2.0、HuBERT和WavLM),启动并提出了针对儿童语音数据库的全面基准测试。此外,我们调查了通过比较各种数据增强和参数高效微调(PEFT)方法来进行微调的策略。我们观察到这些方法在模型规模增大时行为不同。例如,PEFT在大型模型中与完整微调相当,但在小型模型中表现更差。为稳定使用增强数据的微调,我们提出了一种扰动不变微调(PIF)损失作为正则化。

关键词

引用

@article{arxiv.2406.10507,
  title  = {Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models},
  author = {Ruchao Fan and Natarajan Balaji Shankar and Abeer Alwan},
  journal= {arXiv preprint arXiv:2406.10507},
  year   = {2024}
}

备注

To appear in Interspeech 2024