利用音素级能量序列的可控歌声合成
声音
2025-09-10 v1 人工智能
音频与语音处理
摘要
可控歌声合成(SVS)旨在生成反映用户意图的富有表现力的歌声。尽管近期的 SVS 系统实现了高音频质量,但大多数依赖于概率建模,限制了对动态等属性的精确控制。我们通过聚焦动态控制——对音乐表现力至关重要的时间响度变化——来解决这一问题,并明确地以从真实频谱图中提取的能量序列作为 SVS 模型的条件,从而降低标注成本并提高可控性。我们还提出了一种音素级能量序列,以实现用户友好的控制。据我们所知,这是在 SVS 中实现用户驱动动态控制的首次尝试。实验表明,与基线和能量预测模型相比,我们的方法在不损害合成质量的情况下,使音素级输入的能量序列平均绝对误差降低了 50\% 以上。
引用
@article{arxiv.2509.07038,
title = {Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence},
author = {Yerin Ryu and Inseop Shin and Chanwoo Kim},
journal= {arXiv preprint arXiv:2509.07038},
year = {2025}
}
备注
Accepted to ASRU 2025