情感引导的图像到音乐生成
声音
2024-10-30 v1 计算机视觉与模式识别
机器学习
图像与视频处理
摘要
从图像生成音乐可以增强各种应用,包括照片幻灯片的背景音乐、社交媒体体验和视频创作。本文提出了一种情感引导的图像到音乐生成框架,该框架利用效价-唤醒度(VA)情感空间来生成与给定图像情感基调一致的音乐。与以往依赖对比学习来保持情感一致性的模型不同,所提出的方法直接整合了一个 VA 损失函数,以实现准确的情感对齐。该模型采用 CNN-Transformer 架构,具有预训练的 CNN 图像特征提取器和三个 Transformer 编码器,以从 MIDI 音乐中捕捉复杂、高层次的情感特征。三个 Transformer 解码器精炼这些特征,以生成在音乐和情感上一致的 MIDI 序列。在一个新整理的、情感配对的图像-MIDI 数据集上的实验结果表明,所提出的模型在复音率、音高熵、律动一致性和损失收敛等指标上表现出优越的性能。
引用
@article{arxiv.2410.22299,
title = {Emotion-Guided Image to Music Generation},
author = {Souraja Kundu and Saket Singh and Yuji Iwahori},
journal= {arXiv preprint arXiv:2410.22299},
year = {2024}
}
备注
2024 6th Asian Digital Image Processing Conference