OMG挑战赛中多模态情绪识别的逐帧方法
人工智能
2018-05-04 v1 计算与语言
计算机视觉与模式识别
摘要
在本报告中,我们描述了一种方法,在OMG情绪识别挑战赛中对种情绪取得了的非加权准确率,对唤醒度与效价分别取得和的均方误差。我们的结果来自分别在视频的语音与人脸数据上训练的单模态模型集成。我们将每个流视为帧序列。接着我们从帧中提取特征并用循环神经网络处理。音频帧是指秒短的频谱图区间。为估计人脸图片特征,我们使用了在AffectNet数据库上预训练的自主ResNet神经网络。每张短频谱图被视为图片也由卷积网络处理。作为基础音频模型,我们使用了在说话人识别任务中预训练的ResNet。两种模态的预测在决策层融合,并将单通道方法提高了几个百分点。
引用
@article{arxiv.1805.01369,
title = {Framewise approach in multimodal emotion recognition in OMG challenge},
author = {Grigoriy Sterling and Andrey Belyaev and Maxim Ryabov},
journal= {arXiv preprint arXiv:1805.01369},
year = {2018}
}