面向 cVAE 基于 singing voice synthesis 的潜在不匹配消除:基于流匹配
声音
2026-03-16 v2 人工智能
音频与语音处理
摘要
唱作语音合成(SVS)旨在从符号化乐谱生成自然且富有表现力的唱声波形。然而,在基于 cVAE 的 SVS 中,存在一种不匹配问题:解码器是在使用来自目标唱声信号推断的潜在表示进行训练的,而推理时则仅依赖于来自条件输入预测的潜在表示。这一差异可能削弱合成输出中精细的声学细节。为消除这一问题,我们提出了 FM-Singer,一个基于流匹配的潜在细化框架,用于 cVAE 基于唱作语音合成。该方法不重新设计声学解码器,而是学习一个连续向量场,将推理时的潜在样本通过 ODE 集成transport到后验似然潜在表示。由于细化在潜在空间中进行,该方法保持轻量且兼容强大的并行合成主干。在韩语和中文唱作数据集上进行实验,结果表明所提出的潜在细化在客观指标和感知质量方面均取得改进,同时保持实用的合成效率。这些结果表明,减少训练-推理潜在不匹配是提高富有表现力唱作语音合成的有用方向。代码、预训练模型和音频演示已公开于 https://github.com/alsgur9368/FM-Singer。
引用
@article{arxiv.2601.00217,
title = {Mitigating Latent Mismatch in cVAE-Based Singing Voice Synthesis via Flow Matching},
author = {Minhyeok Yun and Yong-Hoon Choi},
journal= {arXiv preprint arXiv:2601.00217},
year = {2026}
}