基于时空卷积神经网络的连续情绪识别
计算机视觉与模式识别
2021-01-18 v2 机器学习
摘要
面部表情是刻画人类行为中特定模式并描述人类情绪状态最有力的方式之一。尽管过去十年情感计算取得了令人印象深刻的进展,基于视频的自动面部表情识别系统仍无法妥善处理个体间面部表情差异以及跨文化与人口统计学方面的因素。然而,即便对人类而言,识别面部表情也是一项困难任务。本文中,我们研究了基于卷积神经网络(CNNs)的先进深度学习架构在利用野外采集的长视频序列进行连续情绪识别中的适用性。本研究聚焦于允许在视频中编码时空关系并考虑复杂多维情绪空间的深度学习模型,其中必须预测效价与唤醒度的值。我们开发并评估了结合2D-CNN与长短期记忆单元的卷积循环神经网络,以及膨胀3D-CNN模型——后者通过在微调期间膨胀预训练2D-CNN模型的权重构建,使用特定应用的视频。在具有挑战性的SEWA-DB数据集上的实验结果表明,这些架构可有效微调以编码来自连续原始像素图像的时空信息,并在该数据集上取得最先进结果。
引用
@article{arxiv.2011.09280,
title = {Continuous Emotion Recognition with Spatiotemporal Convolutional Neural Networks},
author = {Thomas Teixeira and Eric Granger and Alessandro Lameiras Koerich},
journal= {arXiv preprint arXiv:2011.09280},
year = {2021}
}
备注
33 pages