中文

基于一致性的无监督自训练用于ASR个性化

音频与语音处理 2024-01-23 v1 声音

摘要

在大规模人群语音数据上训练的端侧自动语音识别(ASR)模型,对于训练期间未见过的个体可能表现不佳。这是由于用户数据与原始训练数据之间存在领域偏移,这种偏移源于用户的说话特征和环境声学条件的不同。ASR个性化是一种旨在利用用户数据来提高模型鲁棒性的解决方案。大多数ASR个性化方法都假设有标记的用户数据进行监督。在没有任何标记数据的情况下进行个性化具有挑战性,因为数据量有限且录制的音频样本质量较差。这项工作通过开发一种基于伪标签的新型一致性训练方法来解决无监督个性化问题。与预训练模型相比,我们的方法在无标记训练数据上实现了17.3%的相对词错误率降低(WERR),在保留数据上实现了8.1%的相对词错误率降低,并且优于当前最先进的方法。

关键词

引用

@article{arxiv.2401.12085,
  title  = {Consistency Based Unsupervised Self-training For ASR Personalisation},
  author = {Jisi Zhang and Vandana Rajan and Haaris Mehmood and David Tuckey and Pablo Peso Parada and Md Asif Jalal and Karthikeyan Saravanan and Gil Ho Lee and Jungin Lee and Seokyeong Jung},
  journal= {arXiv preprint arXiv:2401.12085},
  year   = {2024}
}

备注

Accepted for IEEE ASRU 2023