中文

基于效价-唤醒空间的情感驱动图像与音乐端到端匹配

计算机视觉与模式识别 2020-09-14 v1 多媒体 声音 音频与语音处理

摘要

图像与音乐均能传达丰富的语义,并被广泛用于诱发特定情绪。将具有相似情感的图像与音乐进行匹配,有助于使情感感知更加生动和强烈。现有的基于情感的图像与音乐匹配方法要么采用有限的分类情绪状态,无法很好地反映情绪的复杂性与细微差别,要么使用不切实际的多阶段流水线训练匹配模型。本文中,我们研究基于连续效价-唤醒(VA)空间情感的图文音乐端到端匹配。首先,我们构建了一个大规模数据集,称为 Image-Music-Emotion-Matching-Net (IMEMNet),包含超过 14 万对图像-音乐样本。其次,我们提出跨模态深度连续度量学习(CDCML),以学习一个共享的潜在嵌入空间,该空间在连续匹配空间中保持跨模态相似性关系。最后,我们通过在图像和音乐的 VA 空间中进一步保持单模态情感关系来精炼嵌入空间。嵌入空间中的度量学习与标签空间中的任务回归针对跨模态匹配与单模态 VA 预测进行联合优化。在 IMEMNet 上开展的广泛实验表明,与最先进方法相比,CDCML 在基于情感的图像与音乐匹配上具有优越性。

关键词

引用

@article{arxiv.2009.05103,
  title  = {Emotion-Based End-to-End Matching Between Image and Music in Valence-Arousal Space},
  author = {Sicheng Zhao and Yaxian Li and Xingxu Yao and Weizhi Nie and Pengfei Xu and Jufeng Yang and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2009.05103},
  year   = {2020}
}

备注

Accepted by ACM Multimedia 2020