中文

用于端到端 ASR 的回译风格数据增强

计算与语言 2018-07-31 v1

摘要

本文提出一种用于基于注意力的端到端自动语音识别(E2E-ASR)的新颖数据增强方法,利用大量未与语音信号配对的文本。受机器翻译领域提出的回译技术启发,我们构建了一个神经文本到编码器模型,该模型从字符序列预测由预训练 E2E-ASR 编码器提取的隐状态序列。通过使用隐状态而非声学特征作为目标,由于 E2E-ASR 编码器中的下采样,可实现更快的注意力学习并降低计算成本,且不同于声学特征,隐状态的使用可避免对说话人依赖建模。训练后,文本到编码器模型从大量未配对文本生成隐状态,然后 E2E-ASR 解码器使用生成的隐状态作为额外训练数据重新训练。使用 LibriSpeech 数据集的实验评估表明,我们提出的方法无需配对数据即提升了 ASR 性能并减少了未知词数量。

关键词

引用

@article{arxiv.1807.10893,
  title  = {Back-Translation-Style Data Augmentation for End-to-End ASR},
  author = {Tomoki Hayashi and Shinji Watanabe and Yu Zhang and Tomoki Toda and Takaaki Hori and Ramon Astudillo and Kazuya Takeda},
  journal= {arXiv preprint arXiv:1807.10893},
  year   = {2018}
}