中文

SiFiSinger:基于源-滤波器机制的高保真端到端歌声合成器

音频与语音处理 2024-10-17 v1 机器学习 声音

摘要

本文提出了一种基于源-滤波器机制的先进端到端歌声合成(SVS)系统,能够将歌词和旋律直接转化为富有表现力的高保真人声歌唱。与VISinger 2类似,该系统采用了从VITS演化而来的训练方案,并整合了基频(F0)预测器和波形解码器等组件。为解决梅尔频谱特征与F0信息耦合导致F0预测误差的问题,我们考虑两种策略:首先,利用梅尔倒谱(mcep)特征来解耦交织的梅尔频谱与F0特征;其次,受神经源-滤波器模型启发,引入激励信号作为F0的表示,以更精确地捕捉音高信息。同时,采用可微分的mcep和F0损失作为波形解码器的监督信号,以增强生成语音中语音包络和音高的准确性。在Opencpop数据集上的实验表明,该模型在合成质量和音高准确性方面均表现出优越性。

关键词

引用

@article{arxiv.2410.12536,
  title  = {SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model},
  author = {Jianwei Cui and Yu Gu and Chao Weng and Jie Zhang and Liping Chen and Lirong Dai},
  journal= {arXiv preprint arXiv:2410.12536},
  year   = {2024}
}

备注

Accepted by ICASSP 2024, Synthesized audio samples are available at: https://sounddemos.github.io/sifisinger