面向Loquacious数据集训练的自动语音识别系统的补充资源与分析
计算与语言
2025-12-23 v1 机器学习
摘要
最近发布的Loquacious数据集旨在成为替代LibriSpeech或TED-Lium等已建立英语自动语音识别(ASR)数据集的资源。Loquacious数据集的主要目标是提供跨多个声学和语言领域的明确定义的训练和测试划分,采用适用于学术界和产业界的开放许可证。为进一步促进该新数据集的基准测试与可用性,我们提供额外资源,包括n-gram语言模型(LMs)、 grapheme-to-phoneme(G2P)模型和发音词典,所有资源均提供开放和公共访问。利用这些额外资源,我们展示了在广泛的ASR架构上进行实验的结果,涵盖不同的标签单元和拓扑结构。我们的初始实验结果表明,Loquacious数据集为ASR中的多种常见挑战提供了可研究的案例。
引用
@article{arxiv.2512.17915,
title = {Supplementary Resources and Analysis for Automatic Speech Recognition Systems Trained on the Loquacious Dataset},
author = {Nick Rossenbach and Robin Schmitt and Tina Raissi and Simon Berger and Larissa Kleppel and Ralf Schlüter},
journal= {arXiv preprint arXiv:2512.17915},
year = {2025}
}