基于集体学习机制的最优传输生成对抗网络用于非平行语音转换
声音
2025-04-21 v1 人工智能
音频与语音处理
摘要
在图像合成领域取得显著成功的生成对抗网络(GAN)模型同样在语音合成领域取得进展,利用其对目标数据分布精确适配的能力。值得注意的是,在最先进(SOTA)GAN-based语音转换(VC)模型中,真实语音与GAN生成语音之间的自然度存在显著差异。此外,许多GAN模型当前 operate on 单生成器-单判别器学习方案,而优化目标数据分布更有效。因此,本研究引入一种新型GAN模型,称为集体学习机制基于最优传输GAN(CLOT-GAN),集成多个判别器,包括深度卷积神经网络(DCNN)模型、Vision Transformer(ViT)和 conformer。将多判别器集成的目标在于它们能够理解mel-频谱图的共振分布,这通过集体学习机制实现。同时,引入最优传输(OT)损失旨在精确桥接源与目标数据分布,遵循OT理论原理。在VCC 2018、VCTK和CMU-Arctic数据集上的实验验证表明,CLOT-GAN-VC模型在客观和主观评估方面优于现有VC模型。
引用
@article{arxiv.2504.13791,
title = {Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion},
author = {Sandipan Dhar and Md. Tousin Akhter and Nanda Dulal Jana and Swagatam Das},
journal= {arXiv preprint arXiv:2504.13791},
year = {2025}
}
备注
7 pages, 2 figures, 3 tables