CoMoSVC:基于一致性模型的歌声转换
音频与语音处理
2024-01-04 v1 人工智能
机器学习
声音
摘要
基于扩散的歌声转换 (SVC) 方法已取得显著性能,能生成与目标音色高度相似的自然音频。然而,迭代采样过程导致推理速度缓慢,因此加速变得至关重要。本文提出 CoMoSVC,一种基于一致性模型的 SVC 方法,旨在同时实现高质量生成和高速采样。首先专门为 SVC 设计一个基于扩散的教师模型,然后基于自一致性特性蒸馏出一个学生模型,以实现一步采样。在单个 NVIDIA GTX4090 GPU 上的实验表明,尽管 CoMoSVC 的推理速度显著快于最先进的 (SOTA) 基于扩散的 SVC 系统,但基于主观和客观指标,它仍能达到可比甚至更优的转换性能。音频样本和代码可在 https://comosvc.github.io/ 获取。
引用
@article{arxiv.2401.01792,
title = {CoMoSVC: Consistency Model-based Singing Voice Conversion},
author = {Yiwen Lu and Zhen Ye and Wei Xue and Xu Tan and Qifeng Liu and Yike Guo},
journal= {arXiv preprint arXiv:2401.01792},
year = {2024}
}