中文

基于分解框架与可推断特征的灵活歌声合成初步探索

声音 2024-07-15 v1 音频与语音处理

摘要

我们探讨了通过分解框架提升歌声合成(SVS)系统灵活性的可行性。由于数据驱动方法,SVS执行音符序列到波形的映射;然而,直接映射限制了控制能力,例如只能合成数据集中存在的语言或歌手。由于收集标注音符的大型歌声数据集成本高昂,我们探讨了一种替代方法,即分解SVS系统并推断不同的歌声特征。我们将SVS系统分解为三阶段模块:语言、音高轮廓与合成,其中诸如语言内容、F0、有无声、歌手嵌入向量、音量等歌声特征可直接从音频中推断。通过该分解框架,我们表明可减轻标注数据集的要求,适配不同语言或歌手,并对歌声的歌词内容进行插值。我们的研究表明,该框架有望达到歌声合成的最新水平,尽管模型具备额外功能并提升了灵活性。对所调查框架当前能力的全面分析为研究社区实现灵活且多功能的SVS系统指明了方向。

关键词

引用

@article{arxiv.2407.09346,
  title  = {A Preliminary Investigation on Flexible Singing Voice Synthesis Through Decomposed Framework with Inferrable Features},
  author = {Lester Phillip Violeta and Taketo Akama},
  journal= {arXiv preprint arXiv:2407.09346},
  year   = {2024}
}

备注

Preliminary investigations