基于掩码循环一致生成对抗网络的无声码器非并行耳语语音转换
声音
2025-06-24 v2 音频与语音处理
摘要
循环一致生成对抗网络已广泛用于非并行语音转换(VC)。其在不依赖并行训练数据的情况下学习源与目标特征间映射的能力,消除了对时间对齐的需要。然而,多数方法通过将声学特征的转换与音频信号合成解耦,使用分离的模型进行转换与波形合成。本工作将转换与合成统一为单一模型,从而消除对独立声码器的需要。通过利用循环一致训练与自监督辅助训练任务,我们的模型能够高效生成转换后的高质量原始音频波形。主观听测表明,我们的统一方法在耳语 VC 中相较基线取得了最高 6.7% 的相对提升。平均意见得分预测在传统 VC 中也给出了稳定结果(0.5% 至 2.4% 的相对提升)。
引用
@article{arxiv.2306.06514,
title = {Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks},
author = {Dominik Wagner and Ilja Baumann and Tobias Bocklet},
journal= {arXiv preprint arXiv:2306.06514},
year = {2025}
}
备注
Accepted at TSD 2025