中文

用于个性化非典型语音ASR的超网络

机器学习 2024-07-04 v4 计算与语言

摘要

参数高效微调(PEFT)用于个性化自动语音识别(ASR)最近显示出将通用人群模型适应非典型语音的前景。然而,这些方法假设事先知道要适应的非典型语音障碍的诊断——诊断需要专家知识,并非总是可用。即使有了这些知识,数据稀缺性和高说话者内/间变异性进一步限制了传统微调的有效性。为了规避这些挑战,我们首先确定了ASR适应所需的最小模型参数集。我们对每个单独参数对适应性能影响的分析使我们能够将词错误率(WER)降低一半,同时仅调整0.03%的权重。为了减轻对群体特定模型的需求,我们接下来提出了一种新颖的使用元学习超网络的方法,为多样化的非典型语音特征即时生成高度个性化的、话语级别的适应。通过评估全局、群体和个体级别的适应,我们表明超网络对分布外说话者具有更好的泛化能力,同时使用完整参数预算的0.1%实现了75.2%的相对WER降低。

关键词

引用

@article{arxiv.2406.04240,
  title  = {Hypernetworks for Personalizing ASR to Atypical Speech},
  author = {Max Müller-Eberstein and Dianna Yee and Karren Yang and Gautam Varma Mantena and Colin Lea},
  journal= {arXiv preprint arXiv:2406.04240},
  year   = {2024}
}