利用自监督提升跨域语音识别
音频与语音处理
2023-08-01 v2 计算与语言
声音
摘要
由于训练与测试分布之间的不匹配,自动语音识别(ASR)的跨域性能可能受到严重损害。由于目标域通常缺乏标注数据,且域偏移存在于声学与语言层面,对 ASR 进行无监督域自适应(UDA)具有挑战性。先前工作表明,自监督学习(SSL)或伪标注(PL)通过利用无标注数据的自监督信号在 UDA 中有效。然而,这些自监督信号在不匹配的域分布中也面临性能退化,这是先前工作未能解决的。本工作提出了一个系统的 UDA 框架,以在预训练与微调范式中充分利用带自监督的无标注数据。一方面,我们应用继续预训练与数据重放技术来缓解 SSL 预训练模型的域不匹配。另一方面,我们提出一种基于 PL 技术的域自适应微调方法,包含三项独特改进:首先,我们设计了一种双分支 PL 方法以降低对错误伪标注的敏感性;其次,我们设计了一种不确定性感知的置信度过滤策略以提高伪标注正确性;第三,我们引入了一种两步 PL 方法来融入目标域语言知识,从而生成更准确的目标域伪标注。在各种跨域场景上的实验结果表明,所提方法有效提升了跨域性能,并显著优于先前方法。
引用
@article{arxiv.2206.09783,
title = {Boosting Cross-Domain Speech Recognition with Self-Supervision},
author = {Han Zhu and Gaofeng Cheng and Jindong Wang and Wenxin Hou and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2206.09783},
year = {2023}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing (TASLP), 2023