一种利用非配对语音与文本的低资源自动语音识别互补联合训练方法
声音
2022-04-06 v1 计算与语言
音频与语音处理
摘要
非配对数据已被证明有益于低资源自动语音识别(ASR),其可参与设计具有多任务训练或语言模型依赖预训练的混合模型。在本工作中,我们利用非配对数据训练一个通用的序列到序列模型。非配对语音与文本通过在模型训练前生成相应的缺失部分,以数据对的形式被使用。受语音-伪标签对与合成音频-文本对在声学特征与语言特征上互补性的启发,我们提出一种互补联合训练(CJT)方法,使用两种数据对交替训练模型。此外,为伪标签提出标签掩码、为合成音频提出梯度限制,以进一步应对与真实数据的偏差,称为 CJT++。实验结果表明,与仅语音训练相比,所提出的基础 CJT 在干净/其他测试集上取得了显著的性能提升,且 CJT++ 重训练带来了进一步的性能增强。同样明显的是,所提方法以相同模型大小与束宽优于 wav2vec2.0 模型,尤其在极低资源情形下。
引用
@article{arxiv.2204.02023,
title = {A Complementary Joint Training Approach Using Unpaired Speech and Text for Low-Resource Automatic Speech Recognition},
author = {Ye-Qian Du and Jie Zhang and Qiu-Shi Zhu and Li-Rong Dai and Ming-Hui Wu and Xin Fang and Zhou-Wang Yang},
journal= {arXiv preprint arXiv:2204.02023},
year = {2022}
}
备注
5 pages, 3 figures