中文

Telephonetic:使神经语言模型对 ASR 与语义噪声鲁棒

音频与语音处理 2019-06-14 v1 计算与语言 机器学习 声音 机器学习

摘要

语音处理系统依赖鲁棒的特征提取来处理自然语言中的语音和语义变化。虽然存在使特征对语音转文本(STT)和文本转语音(TTS)系统产生的常见噪声模式脱敏的技术,但如何最好在带有 ASR 错误的输入上利用最先进的语言模型(其捕获丰富语义特征,但仅在书面文本上训练)仍是一个问题。在本文中,我们提出 Telephonetic,一种数据增强框架,帮助使语言模型特征对 ASR 损坏输入鲁棒化。为捕获语音改变,我们采用通过概率掩码训练的字符级语言模型。语音增强分两阶段生成:TTS 编码器(Tacotron 2、WaveGlow)和 STT 解码器(DeepSpeech)。类似地,语义扰动通过从嵌入空间中的邻近词采样产生,该空间使用 BERT 语言模型计算。词根据分层语法采样策略被选作增强。Telephonetic 在 Penn Treebank(PTB)语料库上评估,并展示其作为将神经语言模型迁移到语音领域的引导技术的有效性。值得注意的是,我们的语言模型在 PTB 上实现了 37.49 的测试困惑度,据我们所知,这是在仅用 PTB 训练的模型中 state-of-the-art 的。

关键词

引用

@article{arxiv.1906.05678,
  title  = {Telephonetic: Making Neural Language Models Robust to ASR and Semantic Noise},
  author = {Chris Larson and Tarek Lahlou and Diana Mingels and Zachary Kulis and Erik Mueller},
  journal= {arXiv preprint arXiv:1906.05678},
  year   = {2019}
}