中文

Art2Mus: 通过跨模态生成连接视觉艺术与音乐

多媒体 2025-07-31 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

人工智能和生成模型已经彻底改变了音乐创作,许多模型利用文本或视觉提示进行引导。然而,现有的图像到音乐模型仅限于简单图像,缺乏从复杂数字化艺术品生成音乐的能力。为了弥补这一差距,我们引入了Art2Mus\mathcal{A}\textit{rt2}\mathcal{M}\textit{us},一种旨在从数字化艺术品或文本输入创作音乐的新型模型。Art2Mus\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}扩展了文本到音频模型AudioLDM~2的架构,并采用了我们通过ImageBind新整理的、将数字化艺术品与音乐配对的数据集。实验结果表明,Art2Mus\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}能够生成与输入刺激产生共鸣的音乐。这些发现预示着在多媒体艺术、互动装置和AI驱动的创意工具中具有广阔的应用前景。

关键词

引用

@article{arxiv.2410.04906,
  title  = {Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation},
  author = {Ivan Rinaldi and Nicola Fanelli and Giovanna Castellano and Gennaro Vessio},
  journal= {arXiv preprint arXiv:2410.04906},
  year   = {2025}
}

备注

Presented at the AI for Visual Arts (AI4VA) workshop at ECCV 2024