中文

MuSE-SVS:控制情感强度的多歌手情感歌声合成器

音频与语音处理 2025-08-12 v3 声音

摘要

我们提出了一种多歌手情感歌声合成器MuSE-SVS,它通过控制音高、能量和音素时长的细微变化来表达不同强度级别的情感,同时精确遵循乐谱。为了控制多种风格属性,同时避免因属性间干扰而导致的保真度和表现力损失,MuSE-SVS通过统一嵌入空间中的联合嵌入来表示所有属性及其关系。MuSE-SVS可以通过嵌入插值和外推来表达训练数据中未包含的情感强度级别。我们还提出了一种统计音高预测器,用于根据情感强度表达音高方差,以及一种上下文感知的残差时长预测器,以防止音素时长方差的累积,这对于与器乐部分的同步至关重要。此外,我们提出了一种新颖的ASPP-Transformer,它结合了空洞空间金字塔池化(ASPP)和Transformer,通过参考广泛的上下文来提高保真度和表现力。在实验中,与基线模型相比,MuSE-SVS表现出更高的保真度、表现力和同步性能。可视化结果表明,MuSE-SVS有效地表达了根据情感强度变化的音高、能量和音素时长方差。据我们所知,MuSE-SVS是第一个能够控制情感强度的神经歌声合成系统。

关键词

引用

@article{arxiv.2203.00931,
  title  = {MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity},
  author = {Sungjae Kim and Yewon Kim and Jewoo Jun and Injung Kim},
  journal= {arXiv preprint arXiv:2203.00931},
  year   = {2025}
}

备注

13 pages, 11 figures