中文

MIMAMO网络:融合微运动与宏运动用于视频情感识别

计算机视觉与模式识别 2019-11-25 v1

摘要

时空特征学习对于视频情感识别至关重要。以往的深层网络结构通常关注跨越长时间尺度(例如以秒为量级)的宏运动。我们认为,融合捕捉微运动和宏运动信息的结构将有助于情感预测,因为人类既能感知微表情也能感知宏表情。在本文中,我们提出结合微运动和宏运动特征,通过一种双流循环网络(命名为MIMAMO(Micro-Macro-Motion)网络)来改进视频情感识别。具体而言,更小且更短的微运动由双流网络分析,而更大且更持续的宏运动可由后续的循环网络很好地捕捉。为网络不同部分分配特定的角色解释,使我们能够基于先验知识选择参数:这些选择被证明是最优的。我们模型的一项重要创新是使用帧间相位差而非光流作为时间流输入。与光流相比,相位差所需计算量更少,并且对光照变化更鲁棒。我们提出的网络在两个视频情感数据集(OMG情感数据集和Aff-Wild数据集)上取得了最先进的性能。最显著的提升在于唤醒度预测,直觉上运动信息对其更具信息量。源代码可在 https://github.com/wtomin/MIMAMO-Net 获取。

关键词

引用

@article{arxiv.1911.09784,
  title  = {MIMAMO Net: Integrating Micro- and Macro-motion for Video Emotion Recognition},
  author = {Didan Deng and Zhaokang Chen and Yuqian Zhou and Bertram Shi},
  journal= {arXiv preprint arXiv:1911.09784},
  year   = {2019}
}

备注

Accepted by AAAI 2020