《古琴音频数据集》:来自非阿拉伯语说话者的众包化与标注化诵读
声音
2024-05-07 v1 人工智能
音频与语音处理
摘要
本文针对非阿拉伯语说话者学习诵读《古琴经》这一挑战,探索了通过众包获取精准标注数据集的可能性,进而可构建 AI 模型以简化学习过程。具体而言,我们采用志愿者众包模式,实现了众包 API 以收集音频素材。我们将该 API 集成到现有的移动应用程序 NamazApp 中,用于收集音频诵读。我们开发了一个名为 Quran Voice 的众包平台,用于对收集到的音频素材进行标注。最终,我们从1287名来自11多个非阿拉伯语国家的志愿者处收集了约7000段《古琴经》诵读,并对数据集中的1166段诵读进行了六类标注。我们实现了0.77的众包准确率,标注者之间为0.63的批间一致性,算法标签与专家判断之间的一致性为0.89。
引用
@article{arxiv.2405.02675,
title = {Quranic Audio Dataset: Crowdsourced and Labeled Recitation from Non-Arabic Speakers},
author = {Raghad Salameh and Mohamad Al Mdfaa and Nursultan Askarbekuly and Manuel Mazzara},
journal= {arXiv preprint arXiv:2405.02675},
year = {2024}
}