中文

BEA-Base:面向匈牙利语自发语音识别的基准数据集

音频与语音处理 2022-02-02 v1 人工智能 计算与语言 声音

摘要

匈牙利语有1500万使用者,但易于获取的自动语音识别(ASR)基准数据集——尤其是针对自发语音的——实际上一直匮乏。本文介绍BEA-Base,它是BEA匈牙利语口语数据库的一个子集,主要包含140位说话人的自发语音。该数据集专为评估ASR而构建,主要面向对话式人工智能应用。在定义语音识别子集与任务后,我们使用开源工具包开发了若干基线系统——包括经典的HMM-DNN混合方法以及由跨语言迁移学习增强的端到端方法。所取得的最佳结果基于多语言自监督预训练,相较于经典方法实现了45%的识别错误率下降——且未使用外部语言模型或额外的有监督数据。结果表明,使用BEA-Base训练和评估匈牙利语语音识别系统是可行的。

关键词

引用

@article{arxiv.2202.00601,
  title  = {BEA-Base: A Benchmark for ASR of Spontaneous Hungarian},
  author = {P. Mihajlik and A. Balog and T. E. Gráczi and A. Kohári and B. Tarján and K. Mády},
  journal= {arXiv preprint arXiv:2202.00601},
  year   = {2022}
}

备注

Submitted to LREC 2022