中文

HebDB:面向希伯来语语音处理的弱监督数据集

计算与语言 2024-07-11 v1 声音 音频与语音处理

摘要

我们提出了 HebDB,这是一个用于希伯来语语音处理的弱监督数据集。HebDB 提供了约 2500 小时的希伯来语自然和自发语音录音,包含大量说话人和话题。我们提供原始录音以及预处理的、弱监督的、过滤后的版本。HebDB 的目标是进一步提升希伯来语语音处理工具的研究和开发。因此,我们还提供了两个基线系统用于自动语音识别(ASR):(i)一个自监督模型;(ii)一个完全监督的模型。我们展示了这两种方法在 HebDB 上优化后的性能,并与当前多语言 ASR 方案进行比较。结果表明,所提出的方法在模型规模相似的情况下,优于所评估的基线。数据集、代码和模型均在 https://pages.cs.huji.ac.il/adiyoss-lab/HebDB/ 上公开。

关键词

引用

@article{arxiv.2407.07566,
  title  = {HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing},
  author = {Arnon Turetzky and Or Tal and Yael Segal-Feldman and Yehoshua Dissen and Ella Zeldes and Amit Roth and Eyal Cohen and Yosi Shrem and Bronya R. Chernyak and Olga Seleznova and Joseph Keshet and Yossi Adi},
  journal= {arXiv preprint arXiv:2407.07566},
  year   = {2024}
}

备注

Accepted at Interspeech2024