面向高效、高质量数据收集的语音基础模型与众包
计算与语言
2024-12-17 v1 声音
音频与语音处理
摘要
尽管众包是促进和扩展语音数据收集的成熟解决方案,但非专业人士的参与需要相应的协议来确保最终数据质量。为了降低这些必要控制的成本,本文研究了使用语音基础模型来自动化验证过程,并首次考察了数据获取中的成本/质量权衡。在法语、德语和韩语数据上进行的实验表明,基于语音基础模型的验证有潜力减少对人工验证的依赖,在不降低最终数据质量的情况下,估计可节省超过 40.0% 的成本。这些发现为更高效、更具成本效益且可扩展的语音数据获取开辟了新机遇。
引用
@article{arxiv.2412.11978,
title = {Speech Foundation Models and Crowdsourcing for Efficient, High-Quality Data Collection},
author = {Beomseok Lee and Marco Gaido and Ioan Calapodescu and Laurent Besacier and Matteo Negri},
journal= {arXiv preprint arXiv:2412.11978},
year = {2024}
}
备注
Accepted at COLING 2025 main conference