在数据有限条件下利用对比学习增强基于 GAN 的声码器
声音
2023-12-19 v2 音频与语音处理
摘要
声码器模型近期在生成可与人类质量媲美的真实音频方面取得实质性进展,同时显著降低了内存需求与推理时间。然而,这些数据饥渴的生成模型需要大规模音频数据以学习良好表征。在本文中,我们将对比学习方法应用于声码器训练,以在不修改其架构或增加更多数据的情况下提升声码器的感知质量。我们设计了一个以梅尔谱图对比学习为辅助任务,以增强数据有限条件下声码器模型的语句级质量。我们还将该任务扩展至包含波形,以改善模型的多模态理解并解决判别器过拟合问题。我们将该附加任务与 GAN 训练目标同时优化。我们的结果表明,这些任务在数据有限设定下大幅提升了模型性能。
引用
@article{arxiv.2309.09088,
title = {Enhancing GAN-Based Vocoders with Contrastive Learning Under Data-limited Condition},
author = {Haoming Guo and Seth Z. Zhao and Jiachen Lian and Gopala Anumanchipalli and Gerald Friedland},
journal= {arXiv preprint arXiv:2309.09088},
year = {2023}
}