JenGAN:基于GAN的语音合成中的堆叠偏移滤波器
音频与语音处理
2024-06-11 v1 人工智能
声音
信号处理
摘要
非自回归GAN-based神经声码器因其快速的推理速度和高保感质量而广泛应用于语音合成。然而,它们常常会产生可听见的伪影,如音色伪影。因此,我们提出JenGAN,这是一种新的训练策略,通过堆叠偏移低通滤波器来确保移位等价性,从而防止别名和减少伪影,同时保留推理期间使用的模型结构。在实验评估中,JenGAN在语音合成器模型上 consistently 提供了显著优于的性能,在大多数评估指标上均取得显著更好的分数。
引用
@article{arxiv.2406.06111,
title = {JenGAN: Stacked Shifted Filters in GAN-Based Speech Synthesis},
author = {Hyunjae Cho and Junhyeok Lee and Wonbin Jung},
journal= {arXiv preprint arXiv:2406.06111},
year = {2024}
}
备注
Accepted to Interspeech 2024