中文

基于多智能体语义情感对齐的音乐到图像生成方法:结合音乐派生的标题

多媒体 2025-12-30 v1

摘要

当人们聆听音乐时,往往会体验丰富的视觉意象。我们旨在通过生成以音乐为条件的图像来实现这种内在意象的外化。我们提出了 MESA MIG 方法,一种多智能体语义和情感对齐框架,首先生成结构化的音乐标题,然后通过专注于场景、运动、风格、颜色和构图的协作智能体对其进行细化。并行地,Valence Arousal 回归头从音乐中预测连续的情感状态,而基于 CLIP 的视觉 VA 标题则从图像中估计情感。这些组件共同实现音乐与合成图像之间的语义和情感对齐。在精心挑选的音乐图像配对实验中,MESA MIG 在审美质量、语义一致性和 VA 对齐方面均优于仅使用标题和单智能体基线方法,并在情感回归性能上与最先进的音乐和图像情感模型保持竞争力。

关键词

引用

@article{arxiv.2512.23320,
  title  = {Multi Agents Semantic Emotion Aligned Music to Image Generation with Music Derived Captions},
  author = {Junchang Shi and Gang Li},
  journal= {arXiv preprint arXiv:2512.23320},
  year   = {2025}
}

备注

10 pages,3 figures.Under review for ICME 2026