中文

基于语音编辑数据增强改进ASR中的语码转换与命名实体识别

计算与语言 2023-06-16 v1 声音 音频与语音处理

摘要

近年来,端到端(E2E)自动语音识别(ASR)模型取得了重大进展,在通用语音识别中表现出优异性能。然而,仍存在若干端到端模型难以胜任的挑战性场景,如语码转换(code-switching)与命名实体识别(NER)。数据增强是应对这两类场景常用且有效的做法。然而,当前数据增强方法主要依赖音频拼接与文本转语音(TTS)模型,可能导致语音不连贯、不真实且多样性不足。为缓解这些潜在问题,我们提出一种新颖的数据增强方法,应用基于文本的语音编辑模型。语音编辑系统生成的增强语音更加连贯、多样,也更接近真实语音。在语码转换与NER任务上的实验结果表明,我们所提方法显著优于基于音频拼接与神经TTS的数据增强系统。

关键词

引用

@article{arxiv.2306.08588,
  title  = {Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation},
  author = {Zheng Liang and Zheshu Song and Ziyang Ma and Chenpeng Du and Kai Yu and Xie Chen},
  journal= {arXiv preprint arXiv:2306.08588},
  year   = {2023}
}

备注

Accepted by Interspeech 2023