EmoNets:用于视频中情绪识别的多模态深度学习方法
机器学习
2015-03-31 v2 计算机视觉与模式识别
摘要
野外情绪识别(EmotiW)挑战赛的任务是为好莱坞风格电影中提取的短视频片段分配七种情绪之一。这些视频在真实条件下演绎情绪,在姿态和光照等属性上有很大变化,这使得探索考虑来自多模态特征组合以进行标签分配的方法变得有价值。在本文中,我们提出了使用深度学习技术学习多个专家模型的方法,每个模型专注于一种模态。其中包括聚焦捕获检测到人脸中视觉信息的卷积神经网络、聚焦音频流表示的深度信念网络、提取嘴部周围视觉特征的基于K-Means的"bag-of-mouths"模型,以及处理视频时空关系的关系自编码器。我们探索了将这些模态中的线索组合到一个共同分类器中的多种方法。这比我们最强的单模态分类器的预测实现了相当高的准确率。我们的方法是2013年EmotiW挑战赛的获胜提交,并在2014年数据集上实现了47.67%的测试集准确率。
引用
@article{arxiv.1503.01800,
title = {EmoNets: Multimodal deep learning approaches for emotion recognition in video},
author = {Samira Ebrahimi Kahou and Xavier Bouthillier and Pascal Lamblin and Caglar Gulcehre and Vincent Michalski and Kishore Konda and Sébastien Jean and Pierre Froumenty and Yann Dauphin and Nicolas Boulanger-Lewandowski and Raul Chandias Ferrari and Mehdi Mirza and David Warde-Farley and Aaron Courville and Pascal Vincent and Roland Memisevic and Christopher Pal and Yoshua Bengio},
journal= {arXiv preprint arXiv:1503.01800},
year = {2015}
}