ASR Bundestag:一个大规模德语政治辩论数据集
计算与语言
2023-02-14 v1 人工智能
机器学习
声音
音频与语音处理
摘要
我们提出ASR Bundestag,一个用于德语自动语音识别的数据集,包含610小时对齐的音频-文本对用于监督训练,以及1,038小时无标注音频片段用于自监督学习,数据基于德国议会全体大会和委员会会议的原始音频数据与转录文本。此外,我们讨论了用于自动构建语音数据集的方法,并基于最先进预训练模型的评估和微调对所得数据集的质量进行了评估。我们公开了该数据集,包括所有子集。
引用
@article{arxiv.2302.06008,
title = {ASR Bundestag: A Large-Scale political debate dataset in German},
author = {Johannes Wirth and René Peinl},
journal= {arXiv preprint arXiv:2302.06008},
year = {2023}
}
备注
13 pages, 2 tables, 4 figures