面向高保真声码器的时频表示判别器研究
声音
2024-04-29 v1 音频与语音处理
信号处理
摘要
基于生成对抗网络(GAN)的声码器在从声学表示重建可听波形时,在推理速度和合成质量上均具有优势。本研究重点关注改进基于 GAN 的声码器的判别器。大多数现有的基于时频表示(TFR)的判别器植根于短时傅里叶变换(STFT),其具有恒定的时频(TF)分辨率、线性缩放中心频率和固定的分解基,这使其不适用于诸如歌声等需要对不同频段和不同时间间隔进行动态关注的信号。受此启发,我们提出了一种多尺度子带常数 Q 变换 CQT(MS-SB-CQT)判别器和一种多尺度时间压缩连续小波变换 CWT(MS-TC-CWT)判别器。CQT 和 CWT 对不同频段均具有动态的时频分辨率。相比之下,CQT 在音高信息上具有更好的建模能力,而 CWT 在短时瞬态上具有更好的建模能力。在语音和歌声上进行的实验证实了我们提出的判别器的有效性。此外,基于 STFT、CQT 和 CWT 的判别器可以联合使用以获得更好的性能。所提出的判别器能够提升多种 SOTA 基于 GAN 的声码器的合成质量,包括 HiFi-GAN、BigVGAN 和 APNet。
引用
@article{arxiv.2404.17161,
title = {An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder},
author = {Yicheng Gu and Xueyao Zhang and Liumeng Xue and Haizhou Li and Zhizheng Wu},
journal= {arXiv preprint arXiv:2404.17161},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2311.14957