中文

规模化语音增强:探讨关键数据集属性的效率影响

音频与语音处理 2024-12-20 v1 声音

摘要

最近的语音增强模型通过扩大模型复杂度和训练数据量显示出显著的性能提升。然而,数据集的可变性(例如文本、语言、说话人和噪声)对性能的影响尚未得到充分探讨。逐个分析每个属性通常很具挑战性,因为多个属性通常在常用数据集中被捆绑,成为理解每个属性对模型性能贡献的独立作用的主要障碍。为此,我们提出了一种利用零样本文本转语音系统进行的生成-训练-评估框架,以探讨受控属性变化对语音增强性能的影响。它使我们能够可扩展地合成训练数据集,同时仔细更改每个属性。基于所提出的框架,我们分析了各种数据集属性对判别式和生成式语音增强模型性能的规模效应。多域语料库的广泛实验表明,声学属性(例如说话人和噪声)对当前语音增强模型的重要性远高于语义属性(例如语言和文本),为未来研究提供了新的见解。

关键词

引用

@article{arxiv.2412.14890,
  title  = {Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling},
  author = {Leying Zhang and Wangyou Zhang and Chenda Li and Yanmin Qian},
  journal= {arXiv preprint arXiv:2412.14890},
  year   = {2024}
}