中文

Art2Music:基于多模态情感对齐的艺术图像音乐生成

声音 2025-12-02 v1 人工智能 计算机视觉与模式识别 机器学习 多媒体

摘要

随着 AI 生成内容(AIGC)的兴起,从多模态输入生成感知自然且情感对齐的音乐已成为核心挑战。现有方法常依赖需要高成本标注的明确情感标签,亟需更灵活的情感对齐方法。为支持多模态音乐生成,我们构建了 ArtiCaps 数据集,这是一个由从 ArtEmis 和 MusicCaps 中语义匹配描述创建的伪情感对齐图像-音乐-文本数据集。我们进一步提出 Art2Music,一个轻量级跨模态框架,用于从艺术图像和用户评论中生成音乐。在第一个阶段,图像和文本使用 OpenCLIP 编码,并通过门控残差模块进行融合;融合表示由双向 LSTM 解码为 Mel-频谱图,采用频率加权 L1 损失以增强高频保真度。在第二个阶段,微调的 HiFi-GAN 声码器重建高质量音频波形。在 ArtiCaps 上的实验显示,Mel-cepstral 失真、Fréchet 音频距离、Log-谱距离和余弦相似度均取得明显改进。小规模的 LLM 基于评分研究进一步验证了跨模态情感对齐的一致性,并提供了匹配与不匹配跨模态的可解释解释。这些结果表明,Art2Music 在感知自然性、频谱保真度和语义一致性方面均取得改进。Art2Music 仅需 50k 训练样本即可保持稳健性能,为情感对齐创意音频生成在交互式艺术、个性化声景和数字艺术展览中提供了可扩展的解决方案。

关键词

引用

@article{arxiv.2512.00120,
  title  = {Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment},
  author = {Jiaying Hong and Ting Zhu and Thanet Markchom and Huizhi Liang},
  journal= {arXiv preprint arXiv:2512.00120},
  year   = {2025}
}