AutoPrep:一种面向野外语音数据的自动预处理框架
音频与语音处理
2023-09-26 v1 声音
摘要
近年来,大规模开源文本数据的使用显著提升了基于文本的大语言模型(LLM)的性能。然而,语音技术社区中野外大规模语音数据的使用仍受限制。造成这一限制的原因之一是,大量公开可用的语音数据受到背景噪声、语音重叠、缺乏语音分段信息、说话人标签缺失以及转写不完整等问题的影响,这极大妨碍了其实用性。另一方面,人工标注语音数据既耗时又昂贵。为解决此问题,本文提出一种自动野外语音数据预处理框架(AutoPrep),旨在自动提升语音质量、生成说话人标签并产出转写文本。所提出的 AutoPrep 框架包含六个组件:语音增强、语音分段、说话人聚类、目标语音提取、质量过滤与自动语音识别。在开源的 WenetSpeech 与我们自行收集的 AutoPrepWild 语料库上的实验表明,所提出的 AutoPrep 框架生成的预处理数据在 DNSMOS 与 PDNSMOS 分数上与若干开源 TTS 数据集相近。相应的 TTS 系统可达到最高 0.68 的域内说话人相似度。
引用
@article{arxiv.2309.13905,
title = {AutoPrep: An Automatic Preprocessing Framework for In-the-Wild Speech Data},
author = {Jianwei Yu and Hangting Chen and Yanyao Bian and Xiang Li and Yi Luo and Jinchuan Tian and Mengyang Liu and Jiayi Jiang and Shuai Wang},
journal= {arXiv preprint arXiv:2309.13905},
year = {2023}
}