基于条件变分自编码器的端到端块级流式唱声合成系统 CSSinger
音频与语音处理
2024-12-16 v2
摘要
唱声合成 (Singing Voice Synthesis, SVS) 旨在生成高保真度和可表达性的唱声。传统的 SVS 系统通常利用声学模型将音乐谱成分转化为声学特征, 然后通过合成器重构唱声。最近的研究表明, 端到端建模在 SVS 和文本转语音 (TTS) 领域都有效。本 work 中, 我们提出了一种完全端到端的 SVS 方法, 并结合块级流式推理以解决实际应用中的延迟问题。请注意, 这是首次在 VAE 的潜在表示中完全实现端到端流式音频合成。我们对增强流式 SVS 使用潜在表示的性能做出了特定的改进。实验结果表明, 所提出的方法在流式 SVS 和 TTS 任务中均实现了高可表达性和正确的音高。
引用
@article{arxiv.2412.08918,
title = {CSSinger: End-to-End Chunkwise Streaming Singing Voice Synthesis System Based on Conditional Variational Autoencoder},
author = {Jianwei Cui and Yu Gu and Shihao Chen and Jie Zhang and Liping Chen and Lirong Dai},
journal= {arXiv preprint arXiv:2412.08918},
year = {2024}
}
备注
Accepted by AAAI2025