中文

芬兰议会 ASR 语料库——分析、基准与统计

计算与语言 2022-03-29 v1 声音 音频与语音处理

摘要

议会会议录音与转录稿等公共来源为自动语音识别(ASR)系统的训练与评估提供了不断增长的材料。本文发布并分析了芬兰议会 ASR 语料库,这是最大的公开芬兰语人工转写语音数据集合,含超过 3000 小时语音及 449 名说话人,并提供了丰富的 demographic 元数据。该语料库基于早前初步工作,因此自然划分为来自两个时段的训练子集。类似地,有两个涵盖不同时期的官方校正测试集,设定了具时间分布偏移特征的 ASR 任务。亦提供一个官方开发集。我们开发了完整的基于 Kaldi 的数据准备流程,以及隐马尔可夫模型(HMM)、混合深度神经网络(HMM-DNN)与基于注意力的编码器-解码器(AED)ASR 方案。我们在官方测试集及多个其他近期所用测试集上设定基准。两个时间语料子集均已足够大,我们观察到除其规模外,官方测试集上 ASR 性能趋于平稳,而其他域则从增加数据中获益。HMM-DNN 与 AED 方法在精心匹配的等量数据设定下比较,HMM-DNN 系统始终表现更优。最后,比较议会元数据中可用说话人类别间的 ASR 精度差异,以检测基于性别、年龄与教育等因素的潜在偏差。

关键词

引用

@article{arxiv.2203.14876,
  title  = {Finnish Parliament ASR corpus - Analysis, benchmarks and statistics},
  author = {Anja Virkkunen and Aku Rouhe and Nhan Phan and Mikko Kurimo},
  journal= {arXiv preprint arXiv:2203.14876},
  year   = {2022}
}

备注

Submitted to Language Resources and Evaluation