Pureformer-VC:基于纯风格化Transformer模块和三元组判别训练的非并行语音转换
声音
2025-06-11 v1 音频与语音处理
摘要
语音转换(VC)作为智能人机交互的基础技术,旨在将任意来源语音转换为任意目标语音。基于生成对抗网络(GAN)的传统语音转换方法面临在精确编码多样化语音元素和有效合成这些元素至自然语音方面的挑战。为克服这些限制,我们引入 Pureformer-VC,一个采用编码器-解码器框架的方案。编码器采用 Conformer 模块构建无缝解耦编码器,解码器采用 Zipformer 模块实现风格迁移。我们采用变分解耦训练方法通过变分自编码器(VAE)隔离语音组件,并辅以三元组判别训练以增强说话人判别能力。此外,我们引入注意力风格迁移机制(ASTM)与 Zipformer 的共享权重相结合,以提升解码器中的风格迁移性能。我们在两个多说话人数据集上进行实验。实验结果表明,在许多对多和许多对一的 VC 场景中,所提出的模型在主观评估得分方面相当,而在客观指标上显著优于现有方法。
引用
@article{arxiv.2506.08348,
title = {Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training},
author = {Wenhan Yao and Fen Xiao and Xiarun Chen and Jia Liu and YongQiang He and Weiping Wen},
journal= {arXiv preprint arXiv:2506.08348},
year = {2025}
}
备注
Accepted by IJCNN 2025