中文

评估面向语音合成的野外数据集预处理流程

音频与语音处理 2025-10-06 v1

摘要

本工作引入了一种可复现、以指标为导向的方法,用于评估面向野外语音合成语料库生成的预处理流程。我们应用了自定义的低成本流程,对首个野外阿根廷西班牙语语料库进行处理,并比较了24种不同的预处理配置,这些配置组合了不同的去噪和质量过滤变体。评估依赖于互补的客观指标(PESQ、SI-SDR、SNR)、声学描述符(T30、C50)以及语音保真度指标(F0-STD、MCD)。结果揭示了数据集规模、信号质量与语音保真度之间的权衡;其中,具有宽松过滤的去噪变体在我们的测试环境中提供了最佳的整体折中方案。该方法论允许在构建语音合成模型的每个子集前,选择性地配置预处理流程,从而加速并降低面向资源匮乏环境的预处理开发成本。

关键词

引用

@article{arxiv.2510.03111,
  title  = {Evaluation of preprocessing pipelines in the creation of in-the-wild TTS datasets},
  author = {Matías Di Bernardo and Emmanuel Misley and Ignacio Correa and Mateo García Iacovelli and Simón Mellino and Gala Lucía Gonzalez Barrios},
  journal= {arXiv preprint arXiv:2510.03111},
  year   = {2025}
}

备注

5 pages, 4 figures, Submitted to ICASSP 2026