中文

LAPS-Diff:基于扩散的歌唱声音合成框架,具有语言感知韵律风格引导学习

声音 2025-12-01 v2 人工智能 音频与语音处理

摘要

近年来,由于扩散方法的快速发展,歌唱声音合成(SVS)领域取得了显著进展。然而,捕捉声音风格、特定类型的音高变化和语言相关特征仍然具有挑战性,尤其是在低资源场景下。为此,我们提出了LAPS-Diff,一种集成了语言感知嵌入和声音风格引导学习机制的扩散模型,专门针对宝莱坞印地语歌唱风格设计。我们整理了一个印地语SVS数据集,并利用预训练语言模型提取词级和音素级嵌入,以丰富歌词表示。此外,我们结合了风格编码器和音高提取模型来计算风格损失和音高损失,捕捉对合成歌唱的自然度和表现力至关重要的特征,特别是在声音风格和音高变化方面。此外,我们利用MERT和IndicWav2Vec模型提取音乐和上下文嵌入,作为条件先验,进一步优化声学特征生成过程。基于客观和主观评估,我们证明,对于我们的受限数据集(典型的低资源场景),与所考虑的最先进(SOTA)模型相比,LAPS-Diff显著提高了生成样本的质量。

关键词

引用

@article{arxiv.2507.04966,
  title  = {LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning},
  author = {Sandipan Dhar and Mayank Gupta and Preeti Rao},
  journal= {arXiv preprint arXiv:2507.04966},
  year   = {2025}
}

备注

10 pages, 5 figures, 3 Tables