用于高保真声码器的多尺度子带恒Q变换判别器
声音
2023-11-28 v1 音频与语音处理
摘要
基于生成对抗网络(GAN)的声码器在从声学表示重建可听波形时,在推理速度和合成质量上具有优势。本研究致力于改进判别器以提升基于 GAN 的声码器。大多数现有的基于时频表示的判别器根植于短时傅里叶变换(STFT),其频谱图的时间-频率分辨率是固定的,这使其难以兼容像歌声这样需要对不同频带灵活关注信号。受此启发,本研究利用恒Q变换(CQT),其在频率间具有动态分辨率,有助于在音高精度和谐波跟踪上更好的建模能力。具体而言,我们提出了一种多尺度子带 CQT(MS-SB-CQT)判别器,它在多尺度上作用于 CQT 频谱图,并根据不同八度进行子带处理。在语音和歌声上进行的实验证实了我们所提方法的有效性。此外,我们还验证了基于 CQT 和基于 STFT 的判别器在联合训练下可互补。具体而言,在提出的 MS-SB-CQT 和现有的 MS-STFT 判别器增强下,HiFi-GAN 的 MOS 在已见歌手中可从 3.27 提升至 3.87,在未见歌手中可从 3.40 提升至 3.78。
引用
@article{arxiv.2311.14957,
title = {Multi-Scale Sub-Band Constant-Q Transform Discriminator for High-Fidelity Vocoder},
author = {Yicheng Gu and Xueyao Zhang and Liumeng Xue and Zhizheng Wu},
journal= {arXiv preprint arXiv:2311.14957},
year = {2023}
}