面向真实场景视频情感分类的时序多模态融合
计算机视觉与模式识别
2017-09-22 v1 机器学习
多媒体
摘要
本文探讨了情感分类问题。该任务旨在预测最能描述短视频片段中所含情感的情感标签(从一组可能的标签中选取)。基于一个标准框架——即通过音频和视觉特征描述视频,并由监督分类器用于推断标签——本文研究了若干新方向。首先,提出了基于2D和3D卷积神经网络的改进人脸描述符。其次,本文探索了多种融合方法,包括时序融合和多模态融合,其中包含一种结合特征与分数的新的层次化方法。此外,我们仔细审视了流程的各个阶段,并设计了一个适应此任务的CNN架构;这一点很重要,因为训练集的规模相对于问题的难度而言较小,使得泛化变得困难。由此得到的模型在2017年Emotion in the Wild挑战赛中排名第四,准确率为58.8%。
引用
@article{arxiv.1709.07200,
title = {Temporal Multimodal Fusion for Video Emotion Classification in the Wild},
author = {Valentin Vielzeuf and Stéphane Pateux and Frédéric Jurie},
journal= {arXiv preprint arXiv:1709.07200},
year = {2017}
}