面向自监督模型更优域自适应的研究:以儿童 ASR 为例
音频与语音处理
2023-05-02 v1
摘要
近年来,基于未标注语音数据的自监督学习(SSL)在自动语音识别(ASR)领域受到越来越多的关注。典型的 SSL 方法包括自回归预测编码(APC)、Wav2vec2.0 和隐单元 BERT(HuBERT)。然而,SSL 模型偏向于预训练数据。当 SSL 模型用来自另一域的数据微调时,会发生域偏移,并可能导致下游任务的知识迁移受限。本文中,我们提出一种新颖框架——域负责自适应与微调(DRAFT)——以减小预训练语音模型中的域偏移,并针对因果与非因果 transformer 对其进行评估。对于因果 transformer,提出 APC 的扩展(E-APC),通过使用多个时间偏移序列进行预测,从未标注数据中学习更丰富的信息。对于非因果 transformer,研究了使用双向 APC(Bi-APC)的多种方案。此外,DRAFT 框架还在以非因果 transformer 为骨干的 Wav2vec2.0 和 HuBERT 方法上进行了检验。实验在儿童 ASR(使用 OGI 和 MyST 数据库)上开展,所用 SSL 模型由 Librispeech 的未标注成人语音数据训练。与未经自适应的预训练模型相比,在两个儿童任务上观察到高达 19.7% 的相对 WER 提升。采用所提方法(E-APC 和 DRAFT)时,与未使用预训练方法的模型相比,相对 WER 提升更大(在 OGI 和 MyST 数据上分别为 30% 和 19%)。
引用
@article{arxiv.2305.00115,
title = {Towards Better Domain Adaptation for Self-supervised Models: A Case Study of Child ASR},
author = {Ruchao Fan and Yunzheng Zhu and Jinhan Wang and Abeer Alwan},
journal= {arXiv preprint arXiv:2305.00115},
year = {2023}
}
备注
Published in IEEE Journal of Selected Topics in Signal Processing, ICASSP Journal Poster Presentation