基于语音编辑数据增强改进ASR中的语码转换与命名实体识别
计算与语言
2023-06-16 v1 声音
音频与语音处理
摘要
近年来,端到端(E2E)自动语音识别(ASR)模型取得了重大进展,在通用语音识别中表现出优异性能。然而,仍存在若干端到端模型难以胜任的挑战性场景,如语码转换(code-switching)与命名实体识别(NER)。数据增强是应对这两类场景常用且有效的做法。然而,当前数据增强方法主要依赖音频拼接与文本转语音(TTS)模型,可能导致语音不连贯、不真实且多样性不足。为缓解这些潜在问题,我们提出一种新颖的数据增强方法,应用基于文本的语音编辑模型。语音编辑系统生成的增强语音更加连贯、多样,也更接近真实语音。在语码转换与NER任务上的实验结果表明,我们所提方法显著优于基于音频拼接与神经TTS的数据增强系统。
引用
@article{arxiv.2306.08588,
title = {Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation},
author = {Zheng Liang and Zheshu Song and Ziyang Ma and Chenpeng Du and Kai Yu and Xie Chen},
journal= {arXiv preprint arXiv:2306.08588},
year = {2023}
}
备注
Accepted by Interspeech 2023