中文

基于深度循环神经网络与神经模糊系统的情感视频到音频转换

声音 2020-04-07 v1 计算机视觉与模式识别 机器学习 机器学习

摘要

生成与输入视频情感相似的音乐是当今一个非常相关的问题。视频内容创作者和自动电影导演受益于保持观众的参与度,这可以通过制作在观众中引发更强情绪的新材料来促进。此外,目前对更具共情能力的计算机有需求,以辅助人类在增强视觉和/或听觉障碍者感知能力等应用中的使用。现有方法在音乐生成步骤中忽视了视频的情感特征,仅考虑静态图像而非视频,无法生成新颖音乐,并且需要高度的人力和技能。在本研究中,我们提出了一种新型混合深度神经网络,其使用自适应神经模糊推理系统(Adaptive Neuro-Fuzzy Inference System)从视频的视觉特征预测其情感,并使用深度长短期记忆循环神经网络(Long Short-Term Memory Recurrent Neural Network)生成具有相似情感倾向的对应音频信号。前者因其模糊特性能够恰当地建模情感,后者由于具备先前隐藏状态信息而能很好地建模具有动态时间属性的数据。我们提出的方法的新颖性在于提取视觉情感特征,并将其转换为具有相应情感方面的音频信号以供用户使用。定量实验在 Lindsey 和 DEAP 数据集上分别显示出 0.217 和 0.255 的低平均绝对误差,以及频谱图中相似的全局特征。这表明我们的模型能够恰当执行视觉与音频特征之间的域转换。基于实验结果,我们的模型能有效生成与场景匹配并在两个数据集中引发观众相似情感的音频,且我们模型生成的音乐也被更频繁地选择。

关键词

引用

@article{arxiv.2004.02113,
  title  = {Emotional Video to Audio Transformation Using Deep Recurrent Neural Networks and a Neuro-Fuzzy System},
  author = {Gwenaelle Cunha Sergio and Minho Lee},
  journal= {arXiv preprint arXiv:2004.02113},
  year   = {2020}
}

备注

Published (https://www.hindawi.com/journals/mpe/2020/8478527/)