面向隐私功能设计的变分编码器-多解码器(VE-MD)用于群体情绪识别
计算机视觉与模式识别
2026-04-06 v1 人工智能
摘要
群体情绪识别(GER)旨在推断课堂、人群和公共活动等社交环境中的集体情感。许多现有方法依赖显式的个体层面处理,包括裁剪人脸、人物追踪或逐人特征提取,这使得分析流程以人为中心,并在仅需群体层面理解的部署场景中引发隐私担忧。本研究提出了VE-MD,一种面向隐私感知功能设计的变分编码器-多解码器群体情绪识别框架。VE-MD并非提供形式化的匿名化或密码学隐私保证,而是通过约束模型仅预测聚合的群体层面情感,避免显式的个体监控,无需身份识别或逐人情感输出。VE-MD学习一个共享的潜在表征,联合优化情感分类和内部身体及面部结构表征的预测。研究了两种结构化解码策略:基于Transformer的PersonQuery解码器和天然适应可变群体规模的密集Heatmap解码器。在六个in-the-wild数据集上的实验,包括两个GER和四个个体情绪识别(IER)基准测试,表明结构监督持续改进表征学习。更重要的是,结果揭示了GER与IER之间的明显区别:仅优化潜在空间往往对GER不足,因为它倾向于削弱交互相关线索,而保留显式结构输出则改进了集体情感推理。相比之下,投影的结构表征对IER似乎起到了有效的去噪瓶颈作用。VE-MD在GAF-3.0上取得了最先进性能(高达90.06%),在VGAF上取得了82.25%(多模态融合含音频)。这些结果表明,在不依赖先验个体特征提取的情况下,保留交互相关的结构信息对群体层面情感建模特别有益。在使用音频模态多模态融合的IER数据集上,VE-MD在SamSemo(77.9%,增加文本模态)上超越了SOTA,在MER-MULTI(63.8%)、DFEW(70.7%)和EngageNet(69.0%)上取得了具有竞争力的性能。
引用
@article{arxiv.2604.02397,
title = {Variational Encoder--Multi-Decoder (VE-MD) for Privacy-by-functional-design (Group) Emotion Recognition},
author = {Anderson Augusma and Dominique Vaufreydaz and Fédérique Letué},
journal= {arXiv preprint arXiv:2604.02397},
year = {2026}
}