远场场景下端到端语音识别的数据增强方法
音频与语音处理
2021-06-08 v1 声音
摘要
尽管端到端自动语音识别(E2E ASR)在拥有大量配对数据的任务上取得了优异性能,但在噪声和低资源条件下使 E2E ASR 具备鲁棒性仍具挑战。本研究探讨了远场场景下 E2E ASR 的数据增强方法。E2E ASR 模型在 CHiME 挑战赛系列数据集上训练,这些任务适合研究对噪声和自发语音的鲁棒性。我们提出使用三种增强方法及其组合:1)使用文本转语音(TTS)数据的数据增强,2)循环一致生成对抗网络(Cycle-GAN)增强,其被训练为映射两种不同音频特征(干净语音与噪声录音)以匹配测试条件,3)由预训练 ASR 模块提供的伪标签增强,用于平滑标签分布。使用 CHiME-6/CHiME-4 数据集的实验结果表明,每种增强方法单独使用均在常规 SpecAugment 基础上提升了准确率;组合这些方法可进一步改进。在 CHiME-6 任务上组合全部三种增强时,我们实现了 4.3% 的词错误率(WER)降低,优于 SpecAugment 的效果。
引用
@article{arxiv.2106.03419,
title = {Data Augmentation Methods for End-to-end Speech Recognition on Distant-Talk Scenarios},
author = {Emiru Tsunoo and Kentaro Shibata and Chaitanya Narisetty and Yosuke Kashiwagi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2106.03419},
year = {2021}
}
备注
Accepted for Interspeech2021