中文

基于多模态融合与长短时上下文的视频情感效应预测

计算机视觉与模式识别 2019-09-05 v1 机器学习

摘要

利用机器学习预测视频的情感影响是一项具挑战性的任务,原因在于模态的多样性、视频复杂的时间上下文以及情感状态的时间依赖性。特征提取、多模态融合与时间上下文融合是预测情感影响中效价与唤醒值的关键阶段,但尚未被成功利用。本文中,我们提出一个综合框架,带有模态结构与多模态融合策略的新颖设计。我们分别为效价与唤醒任务选取最合适模态,且每种模态特征使用在大型通用数据集上特定模态预训练的深度模型提取。我们提出双时间尺度结构,一个用于片段内、另一个用于片段间,以捕获视频内容与情感状态的时间依赖性。为结合来自多模态的互补信息,提出一种高效且有效的基于残差渐进训练策略。每种模态逐步并入多模态模型,负责补全特征的缺失部分。借助上述改进,我们提出的预测框架在LIRIS-ACCEDE数据集上以较大优势优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.1909.01763,
  title  = {Video Affective Effects Prediction with Multi-modal Fusion and Shot-Long Temporal Context},
  author = {Jie Zhang and Yin Zhao and Longjun Cai and Chaoping Tu and Wu Wei},
  journal= {arXiv preprint arXiv:1909.01763},
  year   = {2019}
}