GAViD:面向语境感知的视频组别情感识别的大规模多模态数据集
计算机视觉与模式识别
2026-04-20 v1
摘要
理解现实社会系统中的情感动态是建模和分析复杂环境中人类-人类互动的基本问题。组别情感源于交织的人类-人类互动、语境影响以及行为线索,使得其定量建模成为计算社会系统的具有挑战性的问题。然而,由于受限于大规模标注数据集以及语境和行为变异性所塑造的多模态社交互动的内在复杂性,语境下组别情感的计算建模仍然具有挑战性。缺乏带有多模态和语境信息的全面标注数据集进一步限制了该领域的进步。为此,我们引入了来自视频的组别情感数据集(GAViD),包含5091个视频片段,具备多模态数据(视频、音频和语境),标注了三元价位和离散情感标签,并丰富了来自VideoGPT生成的语境元数据和人工标注的动作线索。我们还提出了语境感知的组别情感识别网络(CAGNet),用于多模态语境感知组别情感识别。CAGNet在GAViD数据集上实现了63.20%的测试准确率,表现相当于最先进的水平。数据集和代码均已公开于github.com/deepakkumar-iitr/GAViD。
引用
@article{arxiv.2604.16214,
title = {GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos},
author = {Deepak Kumar and Abhishek Pratap Singh and Puneet Kumar and Xiaobai Li and Balasubramanian Raman},
journal= {arXiv preprint arXiv:2604.16214},
year = {2026}
}