中文

实时且准确:基于多条件流合成的零样本高保真歌声转换

音频与语音处理 2024-09-10 v2

摘要

歌声转换是将源歌声转换为目标歌声,仅保留内容。目前,基于流的模型可以完成语音转换任务,但在节奏更丰富、情感表达更丰富的歌声转换任务中,它们难以有效提取潜在变量,同时还面临语音处理效率低下的问题。本文提出了一种基于多解耦特征约束的高保真流模型,称为RASVC,该模型通过集成多个潜在属性编码器增强了对声音细节的捕捉。我们还使用多流逆短时傅里叶变换(MS-iSTFT)跳过一些复杂的解码器处理步骤,以提高语音处理速度。我们从多个维度将合成的歌声与其他模型进行比较,所提出的模型与当前最先进技术高度一致,演示可在\url{https://lazycat1119.github.io/RASVC-demo/}获取。

关键词

引用

@article{arxiv.2405.15093,
  title  = {Real-Time and Accurate: Zero-shot High-Fidelity Singing Voice Conversion with Multi-Condition Flow Synthesis},
  author = {Hui Li and Hongyu Wang and Zhijin Chen and Bohan Sun and Bo Li},
  journal= {arXiv preprint arXiv:2405.15093},
  year   = {2024}
}

备注

5 pages,3 figures