用于长语音识别的更新语料库与基准
计算与语言
2023-09-27 v1 声音
音频与语音处理
摘要
绝大多数 ASR 研究使用的语料库中,训练与测试数据均已预先分割为语句。然而,在大多数真实场景的 ASR 应用中,测试音频并未分割,导致推理时条件与基于分割语句训练的模型之间存在失配。在本文中,我们重新发布了三个标准 ASR 语料库——TED-LIUM 3、Gigapeech 和 VoxPopuli-en——并附带更新的转录与对齐,以支持长语音识别研究。我们利用这些重构的语料库研究了转导器与基于注意力的编码器-解码器(AED)的训练-测试失配问题,证实 AED 更易受此问题影响。最后,我们为这些模型基准测试了一种简单的长语音训练方法,展示了其在领域偏移下提升模型鲁棒性的有效性。
引用
@article{arxiv.2309.15013,
title = {Updated Corpora and Benchmarks for Long-Form Speech Recognition},
author = {Jennifer Drexler Fox and Desh Raj and Natalie Delworth and Quinn McNamara and Corey Miller and Migüel Jetté},
journal= {arXiv preprint arXiv:2309.15013},
year = {2023}
}
备注
Submitted to ICASSP 2024