中文

一种用于野外条件下分类与连续情绪识别的音视频与上下文方法

计算机视觉与模式识别 2022-11-04 v3

摘要

在这项工作中,我们在第二届野外情感行为分析研讨会与竞赛(ABAW2)的框架下解决基于视频的音视频情绪识别任务。光照条件差、头部/身体朝向以及低图像分辨率等因素,对于仅依赖面部特征提取与分析的方法而言,可能会阻碍性能表现。为缓解此问题,我们在一个更广泛的情绪识别框架中利用了身体与上下文特征。我们选择使用标准的 CNN-RNN 级联作为所提序列到序列(seq2seq)学习模型的骨干。除通过 RGB 输入模态学习外,我们构建了一个作用于提取的梅尔频谱图序列的听觉流。我们在具有挑战性且新近构建的 Aff-Wild2 数据集上的大量实验,验证了我们所提出的直观多流多模态方法在野外情绪识别中的有效性。重点在于人体与场景上下文的有益影响,这些是迄今为止相对未被探索的情绪识别过程方面。所有代码均使用 PyTorch 实现并公开可用。

关键词

引用

@article{arxiv.2107.03465,
  title  = {An audiovisual and contextual approach for categorical and continuous emotion recognition in-the-wild},
  author = {Panagiotis Antoniadis and Ioannis Pikoulis and Panagiotis P. Filntisis and Petros Maragos},
  journal= {arXiv preprint arXiv:2107.03465},
  year   = {2022}
}

备注

7 pages, 1 figure, 3 tables, accepted to the 2nd Workshop and Competition on Affective Behavior Analysis In-the-Wild (ABAW2)