中文

deepsing:利用跨模态音乐翻译生成情感感知的视觉故事

计算机视觉与模式识别 2019-12-13 v1 人工智能 音频与语音处理

摘要

本文提出一种用于执行基于属性的音乐到图像翻译的深度学习方法。所提方法被应用于根据歌曲表达的情感合成视觉故事。生成的图像旨在向观看者唤起与原始歌曲相同的感受,从而强化音乐的主要目的,即传达情感。音乐到图像的翻译带来了独特的挑战,主要由于该过程中涉及的不同模态之间不稳定的映射关系。本文中,我们采用一种可训练的跨模态翻译方法来克服这一局限,据我们所知,这导致了首个用于生成情感感知视觉故事的深度学习方法的诞生。所提方法的各个方面使用不同歌曲进行了广泛评估和讨论。

关键词

引用

@article{arxiv.1912.05654,
  title  = {deepsing: Generating Sentiment-aware Visual Stories using Cross-modal Music Translation},
  author = {Nikolaos Passalis and Stavros Doropoulos},
  journal= {arXiv preprint arXiv:1912.05654},
  year   = {2019}
}