面向序列到序列 ASR 的即时对齐数据增强
计算与语言
2023-06-13 v2 音频与语音处理
摘要
我们提出了一种用于自动语音识别(ASR)的即时数据增强方法,该方法利用对齐信息生成有效的训练样本。我们的方法称为 ASR 对齐数据增强(ADA),以对齐方式替换转写词元与语音表示,以生成此前未见的训练对。语音表示从训练语料中提取的音频词典中采样,并将说话人变化注入训练样本。转写词元或由语言模型预测(使得增强数据对与原始数据语义接近),或随机采样。两种策略均产生可提升 ASR 训练鲁棒性的训练对。我们在序列到序列(Seq-to-Seq)架构上的实验表明,ADA 可叠加于 SpecAugment 之上,并在 LibriSpeech 100h 与 LibriSpeech 960h 测试集上分别相比单独使用 SpecAugment 在词错误率(WER)上取得约 9-23% 与 4-15% 的相对提升。
引用
@article{arxiv.2104.01393,
title = {On-the-Fly Aligned Data Augmentation for Sequence-to-Sequence ASR},
author = {Tsz Kin Lam and Mayumi Ohta and Shigehiko Schamoni and Stefan Riezler},
journal= {arXiv preprint arXiv:2104.01393},
year = {2023}
}
备注
Accepted at INTERSPEECH 2021