声学特征判别器投影
声音
2025-08-28 v2 人工智能
机器学习
音频与语音处理
机器学习
摘要
在文本语音合成 (TTS) 和语音转换 (VC) 中,通常会使用声学特征(如梅尔频谱图)作为合成或转换目标,因为它们紧凑且易于学习。然而,由于最终目标是生成高质量的波形,在时域中采用声学模型进行对抗训练是合理的。尽管如此,对波形进行上采样会引入显著的时间和内存开销。为此,我们提出了声学特征判别器投影 (VPFD) 方法,该方法使用声学模型特征进行对抗训练。实验表明,使用经过预训练且冻结的声学模型特征提取器仅进行一次上采样步骤,即可实现与波形判别器相当的 VC 性能,同时将训练时间和内存消耗分别降低 9.6 倍和 11.4 倍。
引用
@article{arxiv.2508.17874,
title = {Vocoder-Projected Feature Discriminator},
author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Yuto Kondo},
journal= {arXiv preprint arXiv:2508.17874},
year = {2025}
}
备注
Accepted to Interspeech 2025. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/vpfd/