中文

Music2Palette: 通过跨模态表示学习生成情感对齐的颜色调色板

多媒体 2025-09-18 v2

摘要

音乐与调色板之间的情感对齐对于有效的多媒体内容至关重要,但情感错位会削弱预期信息。然而,现有方法常仅生成单一主导色,忽略情感变化;或通过文本或图像等间接映射,导致关键情感细节丢失。为此,我们提出 Music2Palette,通过跨模态表示学习实现情感对齐的颜色调色板生成。我们首先构建 MuCED 数据集,包含 2634 对经专家验证的音乐-调色板配对,通过 Russell 基于情感的向量对齐。为直接将音乐转化为调色板,我们提出跨模态表示学习框架,包含音乐编码器和颜色解码器。进一步提出多目标优化方法,联合提升情感对齐、颜色多样性和调色板一致性。大量实验表明,我们的方法在解释音乐情感和生成吸引且多样的调色板方面优于当前方法。我们的方法可应用于音乐驱动的图像重新上色、视频生成和数据可视化,弥合听觉和视觉情感体验之间的鸿沟。

关键词

引用

@article{arxiv.2507.04758,
  title  = {Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation Learning},
  author = {Jiayun Hu and Yueyi He and Tianyi Liang and Changbo Wang and Chenhui Li},
  journal= {arXiv preprint arXiv:2507.04758},
  year   = {2025}
}