连接绘画与音乐——基于绘画的情感音乐生成探索
声音
2024-09-13 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
人工智能的快速发展显著增强了涉及音乐和图像的生成任务,采用了单模态和多模态方法。本研究开发了一个模型,能够生成与视觉艺术中描绘的情感产生共鸣的音乐,整合了情感标注、图像描述和语言模型,将视觉输入转化为音乐作品。为解决对齐艺术与音乐数据的稀缺问题,我们策划了情感绘画音乐数据集,将绘画与相应的音乐配对,以进行有效的训练和评估。我们的双阶段框架将图像转换为情感内容的文本描述,然后将这些描述转化为音乐,促进了以最少数据的高效学习。使用Fr\'echet音频距离(FAD)、总谐波失真(THD)、初始分数(IS)和KL散度等指标评估性能,并通过预训练的CLAP模型确认音频-情感文本相似性,展示了生成音乐与文本之间的高度对齐。该合成工具连接了视觉艺术和音乐,增强了视障人士的可访问性,并通过提供丰富的多感官体验,为教育和治疗应用开辟了途径。
引用
@article{arxiv.2409.07827,
title = {Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings},
author = {Tanisha Hisariya and Huan Zhang and Jinhua Liang},
journal= {arXiv preprint arXiv:2409.07827},
year = {2024}
}