中文

Art2Mus:通过视觉条件和大规模跨模态对齐的艺术品到音乐生成

计算机视觉与模式识别 2026-02-20 v1 多媒体 声音

摘要

音乐生成通过多模态深度学习取得了显著进展,使模型能够从文本甚至更近期从图像合成音频。然而,现有的图像条件系统存在两个根本局限:(i) 它们通常在自然照片上训练,限制了其捕捉艺术品更丰富的语义、风格和文化内容的能力;(ii) 大多数依赖于图像到文本转换阶段,使用语言作为语义捷径,这简化了条件但防止了直接的视觉到音频学习。为了克服这些差距,我们引入了 ArtSound,一个由 105,884 对艺术品-音乐配对组成的大规模多模态数据集,包含双模态标题,通过扩展 ArtGraph 和 Free Music Archive 实现。我们进一步提出了 ArtToMus,即第一个专为直接艺术品到音乐生成设计的框架,它无需图像到文本转换或基于语言的语义监督,直接将数字化艺术品映射到音乐。该框架将视觉嵌入投影到潜在扩散模型的条件空间,使音乐合成仅受视觉信息引导。实验结果表明,ArtToMus 生成的音乐在音乐性连贯性和风格一致性方面能够反映源艺术品的显著视觉线索。尽管绝对对齐分数低于文本条件系统——这在消除语言监督方面显著增加了难度——ArtToMus 仍实现了具竞争力的感知质量和有意义的跨模态对应。这一工作确立了直接视觉到音乐生成作为一种独特且具有挑战性的研究方向,并提供了支持多媒体艺术、文化遗产和 AI 辅助创作实践的资源。代码和数据集将在接受后公开。

关键词

引用

@article{arxiv.2602.17599,
  title  = {Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment},
  author = {Ivan Rinaldi and Matteo Mendula and Nicola Fanelli and Florence Levé and Matteo Testi and Giovanna Castellano and Gennaro Vessio},
  journal= {arXiv preprint arXiv:2602.17599},
  year   = {2026}
}