中文

Hard-Synth:使用零样本TTS和大语言模型合成多样化困难样本用于ASR

计算与语言 2024-11-21 v1 声音 音频与语音处理

摘要

文本语音(TTS)模型已被广泛采用以增强自动语音识别(ASR)系统,利用仅包含文本的语料库,从而降低真实语音数据标注成本。现有研究主要利用额外的文本数据和TTS模型支持的预定义语音风格。在本文中,我们提出了Hard-Synth,这是一种新的ASR数据增强方法,利用大语言模型(LLM)和先进的零样本TTS。我们的方法采用LLM通过改写生成多样化的领域内文本,不依赖额外的文本数据。而不是使用预定义的语音风格,我们引入一种带有零样本TTS的硬提示选择方法,以克隆ASR模型难以识别的语音风格。实验表明,Hard-Synth显著增强了Conformer模型,在LibriSpeech dev/test-other子集上实现了6.5%/4.4%的相对词错误率(WER)降低。此外,我们展示了Hard-Synth在数据效率方面具有优势,并且能够减少ASR中的偏差。

关键词

引用

@article{arxiv.2411.13159,
  title  = {Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM},
  author = {Jiawei Yu and Yuang Li and Xiaosong Qiao and Huan Zhao and Xiaofeng Zhao and Wei Tang and Min Zhang and Hao Yang and Jinsong Su},
  journal= {arXiv preprint arXiv:2411.13159},
  year   = {2024}
}