基于随机语句拼接的数据增强以改善短视频语音识别
音频与语音处理
2023-05-26 v2 计算与语言
声音
摘要
端到端自动语音识别(ASR)框架的局限之一在于,若训练与测试语句长度不匹配,其性能会下降。本文提出一种基于在线随机语句拼接(RUC)的数据增强方法,以缓解短视频 ASR 任务中的训练-测试语句长度失配问题。具体而言,我们的动机源于如下观察:人工转写的短视频自发语音训练语句往往更短(平均约 3 秒),而由语音活动检测前端生成的测试语句则长得多(平均约 10 秒)。此种失配会导致次优性能。经验上,观察到所提 RUC 方法显著改善了长语句识别,且在短语句上性能未下降。总体而言,其在 15 种语言上平均实现了 5.72% 的词错误率降低,并提升了对不同语句长度的鲁棒性。
引用
@article{arxiv.2210.15876,
title = {Random Utterance Concatenation Based Data Augmentation for Improving Short-video Speech Recognition},
author = {Yist Y. Lin and Tao Han and Haihua Xu and Van Tung Pham and Yerbolat Khassanov and Tze Yuang Chong and Yi He and Lu Lu and Zejun Ma},
journal= {arXiv preprint arXiv:2210.15876},
year = {2023}
}
备注
5 pages, 3 figures, 4 tables