中文

自教识别器:面向语音基础模型的无监督自适应

计算与语言 2024-05-24 v1 人工智能 机器学习 声音 音频与语音处理

摘要

我们提出了一种无监督自适应框架——自教识别器(STAR),它利用无标签数据增强自动语音识别(ASR)系统在噪声、口音等多样目标域中的鲁棒性。STAR针对基于Transformer相关架构和自回归解码的流行语音基础模型(如Whisper、Canary)而开发。具体而言,我们提出了一种新颖的指标,该指标在解码过程中经验性地整合逐步信息,以在没有真实标签的情况下评估伪标签的词元级质量,从而指导模型更新以实现有效的无监督自适应。实验结果表明,STAR在14个目标域上平均实现了13.5%的词错误率相对降低,有时甚至接近监督自适应的上界性能。令人惊讶的是,我们还观察到STAR在不召回源域数据的情况下,防止了自适应模型常见的灾难性遗忘问题。此外,STAR展现出高数据效率,仅需不到一小时的未标注数据,并且能够无缝泛化到其他大型语音模型和语音翻译任务。我们的代码旨在向研究社区开源。

关键词

引用

@article{arxiv.2405.14161,
  title  = {Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models},
  author = {Yuchen Hu and Chen Chen and Chao-Han Huck Yang and Chengwei Qin and Pin-Yu Chen and Eng Siong Chng and Chao Zhang},
  journal= {arXiv preprint arXiv:2405.14161},
  year   = {2024}
}

备注

23 pages, Preprint