用于端到端中文语音识别的语义数据增强
音频与语音处理
2021-04-27 v1
摘要
端到端模型已逐渐成为自动语音识别(ASR)应用的首选。在端到端 ASR 训练期间,数据增强是规范神经网络的一种十分有效的技术。本文提出一种基于通过句法规则对转录文本进行语义换序的端到端中文 ASR 新型数据增强技术。具体而言,我们首先基于词性标签对转录文本进行分词。然后将换序策略(如将宾语置于主语之前或交换主语与宾语)应用于分词后的句子。最后,根据预训练 ASR 系统产生的音频到文本强制对齐,重新组装与换序后转录文本对应的声学特征。原始数据与增强数据的组合用于训练新的 ASR 系统。实验基于 Transformer[2] 和 Conformer[3] 的 ASR 进行。结果表明所提方法能给系统带来一致的性能提升。还研究了增强相关问题,如不同策略的比较以及数据组合比例。
引用
@article{arxiv.2104.12521,
title = {Semantic Data Augmentation for End-to-End Mandarin Speech Recognition},
author = {Jianwei Sun and Zhiyuan Tang and Hengxin Yin and Wei Wang and Xi Zhao and Shuaijiang Zhao and Xiaoning Lei and Wei Zou and Xiangang Li},
journal= {arXiv preprint arXiv:2104.12521},
year = {2021}
}