为波兰语构建语音数据集 curated 框架与评估 ASR 系统:案例研究
音频与语音处理
2024-08-02 v1 人工智能
计算与语言
机器学习
声音
摘要
公开可用的语音数据集常常未得到充分利用,这主要是由于发现性和互操作性方面的挑战。已设计一个综合框架,用于调查、编目和 curated 可用语音数据集,从而实现可复制的自动语音识别 (ASR) 系统评估。针对波兰语语言开展了案例研究;将该框架应用于 curated 超过 24 个数据集并评估了 25 种 ASR 系统和模型的组合。该研究目前为波兰语最全面的商业与免费 ASR 系统比较,基于 600 项系统-模型-测试集评估,标志着在规模和全面性方面的重大进展。调查和性能比较的结果已作为交互式仪表盘(https://huggingface.co/spaces/amu-cai/pl-asr-leaderboard)公开,同时提供了 curated 数据集(https://huggingface.co/datasets/amu-cai/pl-asr-bigos-v2, https://huggingface.co/datasets/pelcra/pl-asr-pelcra-for-bigos)和开放挑战呼叫(https://poleval.pl/tasks/task3)。用于评估的工具已开源(https://github.com/goodmike31/pl-asr-bigos-tools),便于为其他语言复制和适应,以及通过新增数据集和系统实现持续扩展。
引用
@article{arxiv.2408.00005,
title = {Framework for Curating Speech Datasets and Evaluating ASR Systems: A Case Study for Polish},
author = {Michał Junczyk},
journal= {arXiv preprint arXiv:2408.00005},
year = {2024}
}
备注
Submitted to NeurIPS 2024 Datasets and Benchmarks Track