SaMoye:基于特征解�合与增强的零样图演唱语音转换模型
声音
2024-11-18 v5 人工智能
多媒体
音频与语音处理
摘要
演唱语音转换(Singing Voice Conversion, SVC)旨在将歌手的语音转换为另一位歌手的语音,同时保留原始语义。然而,现有的 SVC 方法几乎无法实现零样图(zero-shot)转换,原因在于特征解�合不完整或依赖歌手查找表(speaker look-up table)。我们提出了首个开源高质量零样图 SVC 模型 SaMoye,能够将演唱转换为人类和非人类音色。SaMoye 将演唱语音的特征解�合为内容特征、音色特征和音高特征,其中我们结合多个自动语音识别(ASR)模型并压缩内容特征以减少音色泄漏。此外,我们通过解冻说话人编码器(speaker encoder)并混合与前 3 个最相似说话人的说话人嵌入(speaker embedding)来增强音色特征。我们还建立了一个空前规模的数据集,以保证零样图性能,该数据集包含超过 1,815 小时的纯演唱语音和 6,367 位说话人。我们进行了客观和主观实验,发现 SaMoye 在零样图 SVC 任务中优于其他模型,即使在极端条件下(如将演唱转换为动物音色)也表现出色。SaMoye 的代码和模型权重已发布于 https://github.com/CarlWangChina/SaMoye-SVC。
引用
@article{arxiv.2407.07728,
title = {SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement},
author = {Zihao Wang and Le Ma and Yongsheng Feng and Xin Pan and Yuhang Jin and Kejun Zhang},
journal= {arXiv preprint arXiv:2407.07728},
year = {2024}
}
备注
This paper needs major changes for resubmit