VoxGenesis:用于语音合成的潜在说话人流形的无监督发现
声音
2024-03-04 v1 机器学习
音频与语音处理
摘要
实现对人类声音的细微而准确的模仿一直是人工智能的长期目标。尽管近年来取得了显著进展,但主流的语音合成模型仍然依赖于有监督的说话人建模和明确的参考话语。然而,人类声音的许多方面,如情感、语调和说话风格,很难获得准确的标签。在本文中,我们提出了VoxGenesis,一种新颖的无监督语音合成框架,它可以在没有监督的情况下发现潜在的说话人流形和有意义的语音编辑方向。VoxGenesis概念上很简单。VoxGenesis不是确定性地将语音特征映射到波形,而是将高斯分布转换为由语义标记条件化和对齐的语音分布。这迫使模型学习一个与语义内容解耦的说话人分布。在推理过程中,从高斯分布中采样可以创建具有独特特征的新说话人。更重要的是,对潜在空间的探索揭示了与特定说话人特征(如性别属性、音高、语调和情感)相关的人类可解释的方向,从而允许通过沿着这些识别出的方向操纵潜在代码来进行语音编辑。我们使用主观和客观指标进行了广泛的实验来评估所提出的VoxGenesis,发现它比先前的方法产生了显著更多样化和逼真的、具有独特特征的说话人。我们还表明,潜在空间操纵产生了一致且人类可识别的效果,且不会损害语音质量,这是先前方法无法实现的。VoxGenesis的音频样本可在以下网址找到:\url{https://bit.ly/VoxGenesis}。
引用
@article{arxiv.2403.00529,
title = {VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis},
author = {Weiwei Lin and Chenhang He and Man-Wai Mak and Jiachen Lian and Kong Aik Lee},
journal= {arXiv preprint arXiv:2403.00529},
year = {2024}
}
备注
preprint