中文

面向序列到序列 ASR 的即时对齐数据增强

计算与语言 2023-06-13 v2 音频与语音处理

摘要

我们提出了一种用于自动语音识别(ASR)的即时数据增强方法,该方法利用对齐信息生成有效的训练样本。我们的方法称为 ASR 对齐数据增强(ADA),以对齐方式替换转写词元与语音表示,以生成此前未见的训练对。语音表示从训练语料中提取的音频词典中采样,并将说话人变化注入训练样本。转写词元或由语言模型预测(使得增强数据对与原始数据语义接近),或随机采样。两种策略均产生可提升 ASR 训练鲁棒性的训练对。我们在序列到序列(Seq-to-Seq)架构上的实验表明,ADA 可叠加于 SpecAugment 之上,并在 LibriSpeech 100h 与 LibriSpeech 960h 测试集上分别相比单独使用 SpecAugment 在词错误率(WER)上取得约 9-23% 与 4-15% 的相对提升。

关键词

引用

@article{arxiv.2104.01393,
  title  = {On-the-Fly Aligned Data Augmentation for Sequence-to-Sequence ASR},
  author = {Tsz Kin Lam and Mayumi Ohta and Shigehiko Schamoni and Stefan Riezler},
  journal= {arXiv preprint arXiv:2104.01393},
  year   = {2023}
}

备注

Accepted at INTERSPEECH 2021