中文

面向儿童的基于组注意的部分模型合并自动语音识别

音频与语音处理 2026-03-20 v2

摘要

虽然对成人预训练模型进行监督式微调用于儿童 ASR 取得了一些进展,但往往无法捕捉儿童之间特定的特征和差异。为此,我们引入了 GRoup-Aware PARtial model Merging(GRAPAM),一种参数高效的方法,结合了无监督聚类、局部分Fine-tuning和模型合并。该方法首先根据声学相似性对儿童数据进行分组,然后对每组数据对预训练的成人模型进行局部分Fine-tuning,最终在参数层面合并这些模型。在 MyST 儿童语语料库上的实验表明,GRAPAM 以相同的数据量实现了 6% 的相对 WER 改进,超越了全参数Fine-tuning,同时训练的参数更少。

关键词

引用

@article{arxiv.2511.23098,
  title  = {Group-Aware Partial Model Merging for Children's Automatic Speech Recognition},
  author = {Thomas Rolland and Alberto Abad},
  journal= {arXiv preprint arXiv:2511.23098},
  year   = {2026}
}

备注

Submitted to Interspeech 2026