基于潜在状态空间建模的文本驱动语音转换
声音
2025-07-31 v2 图形学
音频与语音处理
摘要
文本驱动语音转换允许通过文本描述自定义说话者特征和韵律元素。然而,大多数现有方法高度依赖直接文本转语音训练,限制了其在控制细化风格元素或时彩特征方面的灵活性。本文提出了一种 novel 方法——潜在状态空间(Latent State-Space)方法,用于文本驱动语音转换(LSS-VC)。该方法将每个语音 utterance 视为连续潜在空间中演化的动态系统。借鉴 mamba 引入用于高效文本驱动图像风格迁移的状态空间模型思路,我们为语音风格转换调整了一种松散相关的方法。具体而言,我们学习一个语音潜在流形,其中风格和内容可以通过文本风格提示独立操控。我们提出了一种自适应跨模态融合机制,用于将风格信息注入语音潜在表示,从而实现对说话者身份、说话速度和强调程度的可解释且精细的控制。大量实验表明,我们的方法在主观和客观质量指标上显著优于最近的基线方法,同时提供了更顺畅的风格间转换、更少的伪影以及更精确的文本风格控制。
引用
@article{arxiv.2503.20999,
title = {Text-Driven Voice Conversion via Latent State-Space Modeling},
author = {Wen Li and Sofia Martinez and Priyanka Shah},
journal= {arXiv preprint arXiv:2503.20999},
year = {2025}
}
备注
arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship and affiliation