基于 Transformers 和源-滤波器扭曲的鲁棒低资源儿童语音 ASR 迁移学习
音频与语音处理
2022-06-22 v1 计算与语言
声音
摘要
众所周知,自动语音识别(ASR)系统在转录儿童语音时会表现出困难。这主要可归因于缺乏大型儿童语音语料库来训练鲁棒的 ASR 模型,以及使用成人数据训练的系统解码儿童语音时所产生的领域不匹配。本文中,我们提出了多种增强方法来缓解这些问题。首先,我们提出了一种基于语音源-滤波器模型的数据增强技术,以缩小成人与儿童语音之间的领域差距。这使我们能够通过使这些样本在感知上类似于儿童语音,来利用成人语音语料库的数据可用性。其次,利用这种增强策略,我们在一个基于成人数据预训练的 Transformer 模型上应用迁移学习。该模型遵循最近引入的 XLS-R 架构,这是一个在多个跨语言成人语音语料库上预训练的 wav2vec 2.0 模型,旨在学习通用且鲁棒的声学帧级表示。采用该模型进行 ASR 任务,使用经所提出的源-滤波器扭曲策略增强的成人数据以及有限数量的领域内儿童语音,在 PF-STAR 英国英语儿童语音语料库上显著超越了先前的最佳结果,在官方测试集上取得了 4.86% 的词错误率(WER)。
引用
@article{arxiv.2206.09396,
title = {Transfer Learning for Robust Low-Resource Children's Speech ASR with Transformers and Source-Filter Warping},
author = {Jenthe Thienpondt and Kris Demuynck},
journal= {arXiv preprint arXiv:2206.09396},
year = {2022}
}
备注
proceedings of INTERSPEECH 2022