deepsing:利用跨模态音乐翻译生成情感感知的视觉故事
计算机视觉与模式识别
2019-12-13 v1 人工智能
音频与语音处理
摘要
本文提出一种用于执行基于属性的音乐到图像翻译的深度学习方法。所提方法被应用于根据歌曲表达的情感合成视觉故事。生成的图像旨在向观看者唤起与原始歌曲相同的感受,从而强化音乐的主要目的,即传达情感。音乐到图像的翻译带来了独特的挑战,主要由于该过程中涉及的不同模态之间不稳定的映射关系。本文中,我们采用一种可训练的跨模态翻译方法来克服这一局限,据我们所知,这导致了首个用于生成情感感知视觉故事的深度学习方法的诞生。所提方法的各个方面使用不同歌曲进行了广泛评估和讨论。
引用
@article{arxiv.1912.05654,
title = {deepsing: Generating Sentiment-aware Visual Stories using Cross-modal Music Translation},
author = {Nikolaos Passalis and Stavros Doropoulos},
journal= {arXiv preprint arXiv:1912.05654},
year = {2019}
}