中文

用于端到端 ASR 的多模态数据增强

计算与语言 2018-06-19 v3 声音 音频与语音处理

摘要

我们提出了一种用于自动语音识别(ASR)的端到端新架构,该架构除了传统的声学输入外,还可以使用符号输入进行训练。该架构利用两个独立的编码器:一个用于声学输入,另一个用于符号输入,两者共享注意力机制和解码器参数。我们将此架构称为多模态数据增强网络(MMDA),因为它可以支持多模态(声学和符号)输入,并允许在训练期间将大型文本数据集与规模小得多的转录语音语料库进行无缝混合。我们研究了将大型文本语料库转换为适合训练 MMDA 网络的符号形式的不同方法。我们最佳的 MMDA 设置在字符错误率(CER)上获得了小幅提升,并且在有无外部语言模型的情况下,相对词错误率(WER)均比基线提高了 7-10%。

关键词

引用

@article{arxiv.1803.10299,
  title  = {Multi-Modal Data Augmentation for End-to-End ASR},
  author = {Adithya Renduchintala and Shuoyang Ding and Matthew Wiesner and Shinji Watanabe},
  journal= {arXiv preprint arXiv:1803.10299},
  year   = {2018}
}

备注

5 Pages, 1 Figure, accepted at INTERSPEECH 2018