EMERSK——融合情境知识的可解释多模态情绪识别
计算机视觉与模式识别
2023-06-16 v1 机器学习
多媒体
摘要
随着深度学习算法的日益流行,自动情绪识别近来受到显著关注。情绪识别的主要挑战之一在于有效利用数据中可用的各种线索(模态)。另一挑战是对学习结果提供恰当的解释。为应对这些挑战,我们提出融合情境知识的可解释多模态情绪识别(EMERSK),一种利用视觉信息进行人类情绪识别与解释的通用模块化系统。我们的系统能以灵活模块化方式处理多种模态,包括面部表情、姿态与步态。该网络由不同模块组成,可根据可用数据增减。我们利用带卷积神经网络(CNNs)与编码器-解码器风格注意力机制的双流网络架构从人脸图像提取深度特征。类似地,采用 CNNs 与带长短期记忆(LSTM)的循环神经网络(RNNs)从姿态与步态数据提取特征。我们还融入来自背景的深度特征作为学习过程的上下文信息。各模块的深度特征通过早期融合网络融合。此外,我们利用从场景中提取的位置类型与形容词-名词对(ANP)以及情绪的时空平均分布所导出的情境知识来生成解释。消融研究表明,每个子网络均可独立执行情绪识别,而以多模态方式组合它们显著提升了整体识别性能。在包括 GroupWalk 在内的多个基准数据集上的大量实验验证了我们的方法优于其他最先进方法的性能。
引用
@article{arxiv.2306.08657,
title = {EMERSK -- Explainable Multimodal Emotion Recognition with Situational Knowledge},
author = {Mijanur Palash and Bharat Bhargava},
journal= {arXiv preprint arXiv:2306.08657},
year = {2023}
}
备注
Emotion Recognition, Deep Learning, Multi-modal, Convolutional neural network (CNN), LSTM, Situational-Knowledge, Novelty