MixSpeech:面向低资源自动语音识别的数据增强方法
计算与语言
2021-02-26 v1 声音
音频与语音处理
摘要
本文提出 MixSpeech,一种基于 mixup 的简单而有效的自动语音识别(ASR)数据增强方法。MixSpeech 通过将两种不同语音特征(如梅尔谱图或 MFCC)的加权组合作为输入来训练 ASR 模型,并同时识别两段文本序列,其中两个识别损失使用相同的组合权重。我们将 MixSpeech 应用于两种流行的端到端语音识别模型,包括 LAS(Listen, Attend and Spell)和 Transformer,并在多个低资源数据集(包括 TIMIT、WSJ 和 HKUST)上进行实验。实验结果表明,MixSpeech 比无数据增强的基线模型具有更好的准确率,并在这些识别任务上优于强大的数据增强方法 SpecAugment。具体而言,MixSpeech 在 TIMIT 数据集上以相对 PER 提升 10.6 优于 SpecAugment,并在 WSJ 数据集上取得 4.7 的强劲 WER。
引用
@article{arxiv.2102.12664,
title = {MixSpeech: Data Augmentation for Low-resource Automatic Speech Recognition},
author = {Linghui Meng and Jin Xu and Xu Tan and Jindong Wang and Tao Qin and Bo Xu},
journal= {arXiv preprint arXiv:2102.12664},
year = {2021}
}
备注
To appear at ICASSP 2021