在真实场景中部署自监督学习用于混合式自动语音识别
声音
2022-05-19 v1 计算与语言
音频与语音处理
信号处理
摘要
自监督学习(SSL)方法已被证明在自动语音识别(ASR)中非常成功。这些显著的改进主要基于高度精选的数据集(如 LibriSpeech)以及非流式端到端 ASR 模型进行报道。然而,SSL 的关键特性在于其可被用于任意无转录音频数据。在本文中,我们全面探讨了如何在 SSL 中利用未精选音频数据,涵盖从数据预处理到部署流式混合式 ASR 模型的整个过程。更具体地,我们展示了(1)音频事件检测(AED)模型在数据预处理流程中的作用,(2)关于优化器选择与学习率调度的分析,(3)近期提出的对比损失函数的比较,(4)多种预训练策略的比较,例如使用域内 versus 域外预训练数据、单语 versus 多语预训练数据、多头多语 SSL versus 单头多语 SSL,以及有监督预训练 versus SSL。实验结果表明,使用域内未精选数据进行 SSL 预训练,相比所有其他域外预训练策略均能取得更优性能。
引用
@article{arxiv.2205.08598,
title = {Deploying self-supervised learning in the wild for hybrid automatic speech recognition},
author = {Mostafa Karimi and Changliang Liu and Kenichi Kumatani and Yao Qian and Tianyu Wu and Jian Wu},
journal= {arXiv preprint arXiv:2205.08598},
year = {2022}
}