中文

利用音素级能量序列的可控歌声合成

声音 2025-09-10 v1 人工智能 音频与语音处理

摘要

可控歌声合成(SVS)旨在生成反映用户意图的富有表现力的歌声。尽管近期的 SVS 系统实现了高音频质量,但大多数依赖于概率建模,限制了对动态等属性的精确控制。我们通过聚焦动态控制——对音乐表现力至关重要的时间响度变化——来解决这一问题,并明确地以从真实频谱图中提取的能量序列作为 SVS 模型的条件,从而降低标注成本并提高可控性。我们还提出了一种音素级能量序列,以实现用户友好的控制。据我们所知,这是在 SVS 中实现用户驱动动态控制的首次尝试。实验表明,与基线和能量预测模型相比,我们的方法在不损害合成质量的情况下,使音素级输入的能量序列平均绝对误差降低了 50\% 以上。

关键词

引用

@article{arxiv.2509.07038,
  title  = {Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence},
  author = {Yerin Ryu and Inseop Shin and Chanwoo Kim},
  journal= {arXiv preprint arXiv:2509.07038},
  year   = {2025}
}

备注

Accepted to ASRU 2025