中文

在小波域中发声:一种加速语音扩散模型的简单高效方法

音频与语音处理 2024-09-25 v2 人工智能

摘要

近年来,去噪扩散概率模型 (DDPMs) 在各种生成任务中取得了领先性能。然而,在语音合成领域,尽管 DDPMs 表现出令人印象深刻的性能,但其漫长的训练时间和巨大的推理成本阻碍了实际部署。现有方法主要集中在提高推理速度,而加速训练(这是添加或定制声音相关成本的关键因素)的方法往往需要对模型进行复杂修改,从而损害了其通用适用性。为了解决上述挑战,我们提出一个疑问:是否可以通过修改语音信号本身来提高 DDPMs 的训练/推理速度和性能?在本文中,我们仅通过将生成目标重定向到小波域,就将语音 DDPMs 的训练和推理速度提高了一倍。该方法不仅在语音合成任务中实现了与原始模型相当或更优的性能,还展示了其多功能性。通过研究和利用不同的小波基,我们的方法不仅在语音合成中有效,在语音增强中也同样有效。

关键词

引用

@article{arxiv.2402.10642,
  title  = {Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model},
  author = {Xiangyu Zhang and Daijiao Liu and Hexin Liu and Qiquan Zhang and Hanyu Meng and Leibny Paola Garcia and Eng Siong Chng and Lina Yao},
  journal= {arXiv preprint arXiv:2402.10642},
  year   = {2024}
}