中文

基于卷积特征提取器与循环神经网络的大规模视频数据集情绪识别

计算机视觉与模式识别 2020-06-22 v1 机器学习

摘要

多年来,情绪识别任务一直是人机交互领域中最有趣且最重要的问题之一。在本研究中,我们将情绪识别任务视为分类以及回归任务,通过深度学习模型处理不同数据集中编码的情绪。我们的模型结合卷积神经网络(CNN)与循环神经网络(RNN)来预测视频数据上的维度情绪。第一步,CNN 从视频帧中提取特征向量。第二步,我们将这些特征向量输入训练 RNN,以利用视频的时间动态。此外,我们分析了各神经网络对系统整体性能的贡献。实验在公开可用数据集上进行,包括最大的现代 Aff-Wild2 数据库。其包含超过六十小时的视频数据。我们通过使用混淆矩阵的不平衡数据集上的模型过拟合问题的一个说明性例子发现了该问题。该问题通过降采样技术平衡数据集得以解决。通过显著减少训练数据,我们平衡了数据集,从而提升了模型的整体性能。因此,本研究定性描述了深度学习模型探索足量数据以预测面部情绪的能力。我们提出的方法使用 Tensorflow Keras 实现。

关键词

引用

@article{arxiv.2006.11168,
  title  = {Emotion Recognition on large video dataset based on Convolutional Feature Extractor and Recurrent Neural Network},
  author = {Denis Rangulov and Muhammad Fahim},
  journal= {arXiv preprint arXiv:2006.11168},
  year   = {2020}
}

备注

6 pages, 7 figures, Face and Gesture 2020 Workshop Paper (ABAW2020 competition)