中文

基于潜在独立性的可证明语音属性转换

声音 2025-10-10 v2 人工智能

摘要

尽管信号转换和解耦表示学习在操控音频、图像和多模态生成等领域的属性方面展现出潜力,但现有方法,尤其是在语音风格转换方面,很大程度上仍是基于经验的,缺乏严谨的理论基础来保证可靠且可解释的控制。在本工作中,我们提出了一个通用的语音属性转换框架,并在合理的假设下提供了理论分析与保证。我们的框架建立在非概率自编码器架构之上,并在预测的潜在变量与目标可控变量之间施加独立性约束。该设计确保了在给定观测风格变量的条件下进行一致的信号变换,同时保留原始内容并修改所需属性。我们进一步通过在语音风格(包括说话人身份和情感)上的评估,验证了该方法的通用性。定量评估证实了所提方法的有效性与通用性。

关键词

引用

@article{arxiv.2510.05191,
  title  = {Provable Speech Attributes Conversion via Latent Independence},
  author = {Jonathan Svirsky and Ofir Lindenbaum and Uri Shaham},
  journal= {arXiv preprint arXiv:2510.05191},
  year   = {2025}
}