中文

VocBench:面向语音合成的神经声码器基准

声音 2021-12-07 v1 计算与语言 音频与语音处理

摘要

神经声码器用于将音频信号的频谱表示转换为波形,是语音合成流程中常用的组件。其侧重于从梅尔频谱图等低维表示合成波形。近年来,人们引入了不同的方法来开发此类声码器。然而,评估这些新声码器并将其性能与先前声码器进行比较变得更具挑战性。为解决该问题,我们提出 VocBench,一个对最先进神经声码器性能进行基准测试的框架。VocBench 采用系统性研究在共享环境中评估不同神经声码器,从而实现它们之间的公平比较。在我们的实验中,我们对所有神经声码器使用相同的数据集、训练流程和评估指标设置。我们执行主观和客观评估,以沿不同维度比较每个声码器的性能。我们的结果表明,该框架能够展示每个声码器的竞争效能和合成样本的质量。VocBench 框架可在 https://github.com/facebookresearch/vocoder-benchmark 获取。

关键词

引用

@article{arxiv.2112.03099,
  title  = {VocBench: A Neural Vocoder Benchmark for Speech Synthesis},
  author = {Ehab A. AlBadawy and Andrew Gibiansky and Qing He and Jilong Wu and Ming-Ching Chang and Siwei Lyu},
  journal= {arXiv preprint arXiv:2112.03099},
  year   = {2021}
}

备注

To appear in icassp 2022