SegAug:基于CTC对齐的分段数据增强以增强基于RNN-Transducer的语音识别
声音
2025-02-21 v1 音频与语音处理
摘要
RNN-Transducer(RNN-T)是语音识别中广泛采用的体系结构,集成了声学模型和语言模型,形成端到端框架。然而,RNN-T的预测器倾向于过度依赖训练数据中连续的词汇依赖关系,导致高删除错误率,尤其是在较不常见或跨域短语上。现有解决方案,如正则化和数据增强,往往会牺牲其他性能方面。我们提出SegAug,一种基于对齐的数据增强技术,生成具有低句子级语义的上下文多样化的音频-文本对。该方法鼓励模型更关注声学特征,同时多样化其内部语言模型所学习的文本模式,从而减少删除错误并提升整体性能。在LibriSpeech和Tedlium-v3数据集上的评估显示,在小规模和大规模设置下分别实现了最高12.5%和6.9%的相对WER降低。值得注意的是,大部分改进都来自删除错误的减少,分别为45.4%和18.5%。这些结果凸显了SegAug在提高RNN-T鲁棒性方面的有效性,为在多样化且具挑战性的场景中提升语音识别性能提供了有前景的解决方案。
引用
@article{arxiv.2502.14685,
title = {SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition},
author = {Khanh Le and Tuan Vu Ho and Dung Tran and Duc Thanh Chau},
journal= {arXiv preprint arXiv:2502.14685},
year = {2025}
}
备注
Accepted to ICASSP 2025