利用增强条件判别器在有限数据下训练基于生成对抗网络的声码器
声音
2024-03-26 v1 机器学习
音频与语音处理
摘要
基于生成对抗网络(GAN)并使用对抗判别器训练的声码器因其快速、轻量和高品质的特性而常用于语音合成。然而,这种数据驱动模型需要大量训练数据,导致高昂的数据采集成本。这一事实促使我们在有限数据上训练基于 GAN 的声码器。一种有前景的解决方案是增强训练数据以避免过拟合。然而,标准判别器是无条件的,对数据增强引起的分布变化不敏感。因此,增强后的语音(可能异常)可能被视为真实语音。为解决此问题,我们提出了一种增强条件判别器(AugCondD),该判别器除语音外还接收增强状态作为输入,从而根据增强状态评估输入语音,且不抑制对原始未增强分布的学习。实验结果表明,AugCondD 在有限数据条件下提高了语音质量,同时在充足数据条件下实现了相当的语音质量。音频样本可在 https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/augcondd/ 获取。
引用
@article{arxiv.2403.16464,
title = {Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator},
author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka},
journal= {arXiv preprint arXiv:2403.16464},
year = {2024}
}
备注
Accepted to ICASSP 2024. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/augcondd/