中文

LARA-Gen:通过潜在情感表示对齐实现音乐生成模型的连续情感控制

声音 2026-03-11 v2

摘要

近期文本到音乐模型的进展使得能够从文本提示生成连贯的音乐,但细粒度的情感控制仍未解决。我们引入 LARA-Gen,一个实现连续情感控制的框架,通过潜在情感表示对齐 (LARA) 将内部隐藏状态与外部音乐理解模型对齐,从而实现有效训练。此外,我们设计了一个基于连续价- arousal 空间的情感控制模块,将情感属性从文本内容中解耦,绕过文本式提示的瓶颈。进一步地,我们建立了一个包含精选测试集和稳健情感预测器的基准,促进情感可控性在音乐生成中的客观评估。大量实验表明,LARA-Gen 实现了情感的连续、细粒度控制,并在情感遵循性和音乐质量方面显著优于基线模型。生成样本可在 https://anonymous2232330.github.io/laragen-web/ 查看。

关键词

引用

@article{arxiv.2510.05875,
  title  = {LARA-Gen: Enabling Continuous Emotion Control for Music Generation Models via Latent Affective Representation Alignment},
  author = {Jiahao Mei and Xuenan Xu and Zeyu Xie and Zihao Zheng and Ye Tao and Yue Ding and Mengyue Wu},
  journal= {arXiv preprint arXiv:2510.05875},
  year   = {2026}
}

备注

Submitted to Interspeech 2026