ivrit.ai:面向人工智能研究与开发的希伯来语语音综合数据集
音频与语音处理
2023-07-19 v1 计算与语言
声音
摘要
我们推出“ivrit.ai”,一个希伯来语语音综合数据集,以解决希伯来语自动语音识别(ASR)技术进展中广泛高质量资源明显匮乏的问题。ivrit.ai 拥有超过 3300 小时语音和逾千名不同说话人,提供了跨多种场景的希伯来语语音大量汇编。它以三种形式提供以满足不同研究需求:原始未处理音频、经过语音活动检测(VAD)的数据,以及部分转写数据。该数据集的突出之处在于法律上的可获取性,允许免费使用,从而成为研究人员、开发者和商业实体关键资源。ivrit.ai 开启了众多应用,为提升希伯来语 AI 能力提供巨大潜力。未来的工作旨在进一步扩展 ivrit.ai,从而提升希伯来语在 AI 研究与技术中的地位。
引用
@article{arxiv.2307.08720,
title = {ivrit.ai: A Comprehensive Dataset of Hebrew Speech for AI Research and Development},
author = {Yanir Marmor and Kinneret Misgav and Yair Lifshitz},
journal= {arXiv preprint arXiv:2307.08720},
year = {2023}
}
备注
9 pages, 1 table and 3 figures