用于端到端自动语音识别的听觉驱动数据增强
音频与语音处理
2022-04-12 v1 声音
摘要
端到端模型在自动语音识别上取得了显著改进。扩展数据空间 through 数据增强是提升这些模型性能的一种常用方法。同时,受人类听觉启发的前端也已证明可改善自动语音识别器。本工作中,一个经过充分验证的、可模拟多种听觉能力的基于听觉的模型被研究用于端到端语音识别的数据增强。通过将听觉模型引入数据增强过程,端到端系统被促使忽略信号中不可听见的变动,从而聚焦于对语音识别鲁棒的特征。在LibriSpeech数据集上,以基于Transformer的端到端模型研究了听觉模型中的两种机制:频谱涂抹与响度重振。结果表明,所提出的增强方法能在最先进的SpecAugment性能上带来统计显著的提升。
引用
@article{arxiv.2204.04284,
title = {Auditory-Based Data Augmentation for End-to-End Automatic Speech Recognition},
author = {Zehai Tu and Jack Deadman and Ning Ma and Jon Barker},
journal= {arXiv preprint arXiv:2204.04284},
year = {2022}
}