中文

基于 LSTM 网络同步预测唤醒度与效价用于情感视频内容分析

多媒体 2018-06-04 v1

摘要

视频数据中嵌入的情感传达了关于内容的高级语义信息,并直接影响审阅者的理解与感知以及他们的情绪反应。情感视频内容分析(AVCA)试图在视频内容与相应的情感状态(如唤醒度和效价维度)之间建立直接映射。大多数现有研究使用基于知识的规则或传统分类器(如支持向量机(SVM))为每个维度分别建立映射。情感维度之间的内在相关性在很大程度上未被利用,而这些相关性预计包含用于准确预测情感维度的重要信息。为解决此问题,本文提出一种使用长短期记忆(LSTM)网络同步预测唤醒度和效价维度的方法。该方法从视频数据中提取一组低级音频和视觉特征,并使用 LSTM 网络将它们同步投影为唤醒度和效价值的对,该网络自动结合了唤醒度与效价维度之间的相关性。我们在由来自电影、戏剧和新闻等真实资源的视频片段组成的数据集上评估所提方法的性能,并证明其相对于传统基于 SVM 的方法具有更优性能。结果为考虑情感维度间相关性以实现准确 AVCA 的益处提供了最早的初步证据之一。

关键词

引用

@article{arxiv.1806.00257,
  title  = {Synchronous Prediction of Arousal and Valence Using LSTM Network for Affective Video Content Analysis},
  author = {Ligang Zhang and Jiulong Zhang},
  journal= {arXiv preprint arXiv:1806.00257},
  year   = {2018}
}

备注

pages 689-694, proceedings of ICNC-FSKD 2017