中文

在基于视频的野外视觉情感识别的上下文方法中利用语义场景特征与多流卷积架构

计算机视觉与模式识别 2022-02-03 v1

摘要

在本工作中,我们处理基于视频的野外视觉情感识别任务。仅依赖身体与面部特征提取的标准方法,在上述情感信息源因头部/身体朝向、低分辨率及光照不足而不可获取时,往往难以准确预测情感。我们期望通过将视觉上下文以场景特征与属性的形式作为更广泛情感识别框架的一部分,来缓解该问题。时序分段网络(TSN)构成我们提出模型的骨干。除 RGB 输入模态外,我们采用稠密光流,遵循直观的多流方法以更有效地编码运动。此外,我们将注意力转向基于骨架的学习,并利用以动作中心的数据作为预训练空间-时间图卷积网络(ST-GCN)用于情感识别任务的手段。我们在具有挑战性的身体语言数据集(BoLD)上的大量实验验证了我们的方法相对于现有方法的优越性,同时通过将所有上述模块恰当地集成于网络集成中,我们大幅超越了先前发表的最佳识别分数。

关键词

引用

@article{arxiv.2105.07484,
  title  = {Leveraging Semantic Scene Characteristics and Multi-Stream Convolutional Architectures in a Contextual Approach for Video-Based Visual Emotion Recognition in the Wild},
  author = {Ioannis Pikoulis and Panagiotis P. Filntisis and Petros Maragos},
  journal= {arXiv preprint arXiv:2105.07484},
  year   = {2022}
}

备注

9 pages, 4 figures, 5 tables, submitted to the 16th IEEE International Conference on Automatic Face and Gesture Recognition