中文

基于非体积保持融合的群体视频群体级情绪识别

计算机视觉与模式识别 2022-03-24 v4

摘要

群体级情绪识别(ER)是一个日益增长的研究领域,因为对各类规模人群进行评估的需求正成为安全领域与社交媒体中的关注点。此前 ER 研究聚焦于单幅图像或视频内的群体级 ER,本工作通过充分探究群体视频上的群体级表情识别,拓展了早期研究。本文提出一种有效的深度特征级融合机制,以建模群体视频中的时空信息。在我们的方法中,融合过程由生成式概率模型——非体积保持融合(NVPF)在深度特征域上执行,该模型建模空间信息关系。此外,我们将提出的空间 NVPF 方法扩展为时空 NVPF 方法,以学习帧间时间信息。为证明所提方法各组件的鲁棒性与有效性,进行了三项实验:(i)在 AffectNet 数据库上评估以基准测试所提 EmoNet 的面部表情识别能力;(ii)在 EmotiW2018 上评估以基准测试所提深度特征级融合机制 NVPF;以及(iii)在一个创新的群体视频群体级情绪(GECV)数据集上检验所提 TNVPF,该数据集由 627 个来自公开来源的 video 组成。GECV 数据集为包含人群的视频集合,每个视频在三个层级标注情绪类别:个体人脸、人群组以及整个视频帧。

关键词

引用

@article{arxiv.1811.11849,
  title  = {Non-Volume Preserving-based Fusion to Group-Level Emotion Recognition on Crowd Videos},
  author = {Kha Gia Quach and Ngan Le and Chi Nhan Duong and Ibsa Jalata and Kaushik Roy and Khoa Luu},
  journal= {arXiv preprint arXiv:1811.11849},
  year   = {2022}
}

备注

In press at Patter Recognition Journal