中文

AutoPrep:一种面向野外语音数据的自动预处理框架

音频与语音处理 2023-09-26 v1 声音

摘要

近年来,大规模开源文本数据的使用显著提升了基于文本的大语言模型(LLM)的性能。然而,语音技术社区中野外大规模语音数据的使用仍受限制。造成这一限制的原因之一是,大量公开可用的语音数据受到背景噪声、语音重叠、缺乏语音分段信息、说话人标签缺失以及转写不完整等问题的影响,这极大妨碍了其实用性。另一方面,人工标注语音数据既耗时又昂贵。为解决此问题,本文提出一种自动野外语音数据预处理框架(AutoPrep),旨在自动提升语音质量、生成说话人标签并产出转写文本。所提出的 AutoPrep 框架包含六个组件:语音增强、语音分段、说话人聚类、目标语音提取、质量过滤与自动语音识别。在开源的 WenetSpeech 与我们自行收集的 AutoPrepWild 语料库上的实验表明,所提出的 AutoPrep 框架生成的预处理数据在 DNSMOS 与 PDNSMOS 分数上与若干开源 TTS 数据集相近。相应的 TTS 系统可达到最高 0.68 的域内说话人相似度。

关键词

引用

@article{arxiv.2309.13905,
  title  = {AutoPrep: An Automatic Preprocessing Framework for In-the-Wild Speech Data},
  author = {Jianwei Yu and Hangting Chen and Yanyao Bian and Xiang Li and Yi Luo and Jinchuan Tian and Mengyang Liu and Jiayi Jiang and Shuai Wang},
  journal= {arXiv preprint arXiv:2309.13905},
  year   = {2023}
}