中文

用于长语音识别的更新语料库与基准

计算与语言 2023-09-27 v1 声音 音频与语音处理

摘要

绝大多数 ASR 研究使用的语料库中,训练与测试数据均已预先分割为语句。然而,在大多数真实场景的 ASR 应用中,测试音频并未分割,导致推理时条件与基于分割语句训练的模型之间存在失配。在本文中,我们重新发布了三个标准 ASR 语料库——TED-LIUM 3、Gigapeech 和 VoxPopuli-en——并附带更新的转录与对齐,以支持长语音识别研究。我们利用这些重构的语料库研究了转导器与基于注意力的编码器-解码器(AED)的训练-测试失配问题,证实 AED 更易受此问题影响。最后,我们为这些模型基准测试了一种简单的长语音训练方法,展示了其在领域偏移下提升模型鲁棒性的有效性。

关键词

引用

@article{arxiv.2309.15013,
  title  = {Updated Corpora and Benchmarks for Long-Form Speech Recognition},
  author = {Jennifer Drexler Fox and Desh Raj and Natalie Delworth and Quinn McNamara and Corey Miller and Migüel Jetté},
  journal= {arXiv preprint arXiv:2309.15013},
  year   = {2023}
}

备注

Submitted to ICASSP 2024