VoiceLens:基于流模型的可控说话人生成与编辑
声音
2023-09-26 v1 音频与语音处理
摘要
目前,许多多说话人语音合成与语音转换系统利用嵌入向量来处理说话人差异。直接对该向量建模,可以合成训练数据之外的新声音。诸如 Tacospawn 之类的基于 GMM 的方法因其在生成任务上的表现而在文献中受到青睐,但在涉及困难条件时仍存在一定局限。本文提出 VoiceLens,一种基于流的半监督方法,用于为多条件说话人生成建模说话人嵌入分布。VoiceLens 将说话人嵌入映射为独立属性与残差信息的组合。它允许为现有 TTS 模型生成与特定属性关联的新声音,并对已知声音的属性进行有意义的编辑。本文表明,VoiceLens 展现出与 Tacospawn 相似的无条件生成能力,同时在以条件方式使用时获得更高的可控性与灵活性。此外,我们展示通过仅用 SNR 条件的 VoiceLens 模型编辑已知含噪说话人的嵌入,无需重新训练 TTS 模型即可合成噪声更少的语音。演示见 sos1sos2sixteen.github.io/voicelens。
引用
@article{arxiv.2309.14094,
title = {VoiceLens: Controllable Speaker Generation and Editing with Flow},
author = {Yao Shi and Ming Li},
journal= {arXiv preprint arXiv:2309.14094},
year = {2023}
}