中文

EXPOTION:面向多模态音乐生成的面部表情与动作控制

声音 2025-07-08 v1 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

我们提出了Expotion(Facial Expression and Motion Control for Multimodal Music Generation,即面部表情和动作控制用于多模态音乐生成),这是一种生成模型,利用多模态视觉控制——具体而言是人类面部表情和上半身动作——以及文本提示来生成富有表现力且在时序上精准的音乐。我们对预训练的文本到音乐生成模型采用参数高效微调(PEFT),使其能够使用小数据集实现对多模态控制的精细适应。为确保视频与音乐之间的精确同步,我们引入了一种时序平滑策略以对齐多个模态。实验表明,将视觉特征与文本描述相结合可提升生成音乐在音乐性、创造性、节拍-节奏一致性、与视频的时间对齐以及文本遵循性方面的整体质量,超越了所提出的基线和现有的SOTA视频到音乐生成模型。此外,我们引入了一个新型数据集,包含7小时同步录制的视频,捕捉与相应音乐相符的富有表现力的面部表情和上半身姿态,为未来的多模态和交互式音乐生成研究提供了显著潜力。

关键词

引用

@article{arxiv.2507.04955,
  title  = {EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation},
  author = {Fathinah Izzati and Xinyue Li and Gus Xia},
  journal= {arXiv preprint arXiv:2507.04955},
  year   = {2025}
}