中文

面向真实场景视频情感分类的时序多模态融合

计算机视觉与模式识别 2017-09-22 v1 机器学习 多媒体

摘要

本文探讨了情感分类问题。该任务旨在预测最能描述短视频片段中所含情感的情感标签(从一组可能的标签中选取)。基于一个标准框架——即通过音频和视觉特征描述视频,并由监督分类器用于推断标签——本文研究了若干新方向。首先,提出了基于2D和3D卷积神经网络的改进人脸描述符。其次,本文探索了多种融合方法,包括时序融合和多模态融合,其中包含一种结合特征与分数的新的层次化方法。此外,我们仔细审视了流程的各个阶段,并设计了一个适应此任务的CNN架构;这一点很重要,因为训练集的规模相对于问题的难度而言较小,使得泛化变得困难。由此得到的模型在2017年Emotion in the Wild挑战赛中排名第四,准确率为58.8%。

关键词

引用

@article{arxiv.1709.07200,
  title  = {Temporal Multimodal Fusion for Video Emotion Classification in the Wild},
  author = {Valentin Vielzeuf and Stéphane Pateux and Frédéric Jurie},
  journal= {arXiv preprint arXiv:1709.07200},
  year   = {2017}
}