CrowdSpeech与VoxDIY:面向众包音频转写的基准数据集
声音
2021-10-22 v2 人机交互
机器学习
音频与语音处理
摘要
领域特定数据是机器学习系统从基准成功迁移至现实的关键。在图像分类等简单问题中,众包凭借聚合方法研究的进展,已成为廉价且高效的数据收集标准工具之一。然而,由于缺少针对这些模态的原则性聚合方法,众包对更复杂任务(如语音识别)的适用性仍受限。设计面向更先进应用的聚合方法的主要障碍在于训练数据的缺失,本工作聚焦于弥补语音识别中的这一缺口。为此,我们收集并发布了CrowdSpeech——首个公开可用的大规模众包音频转写数据集。在我们数据上对现有与新聚合方法的评估显示出改进空间,表明本工作或可催生更优算法。在更高层面,我们也致力于更通用的挑战:开发通过众包进行可靠数据收集的方法论。为此,我们设计了一条在任何新领域构建众包音频转写数据集的原则性流程。我们通过构建VoxDIY——CrowdSpeech的俄语对应数据集,展示了其在资源匮乏语言上的适用性。我们还发布了可完整复现数据收集流程的代码,并分享了众包数据收集最佳实践的多项见解。
引用
@article{arxiv.2107.01091,
title = {CrowdSpeech and VoxDIY: Benchmark Datasets for Crowdsourced Audio Transcription},
author = {Nikita Pavlichenko and Ivan Stelmakh and Dmitry Ustalov},
journal= {arXiv preprint arXiv:2107.01091},
year = {2021}
}