使用隐私合规特征进行野外多模态群体情绪识别
人工智能
2023-12-12 v1 密码学与安全
计算机视觉与模式识别
机器学习
音频与语音处理
摘要
本文探讨了在EmotiW 2023挑战赛中,使用隐私合规的群体级情绪识别“在野外”的问题。群体级情绪识别可应用于多个领域,包括社交机器人、对话代理、电子辅导和学习分析。本研究仅使用全局特征,避免个体特征,即所有可用于识别或跟踪视频中人物的特征(面部关键点、身体姿态、音频说话人分割等)。所提出的多模态模型由视频分支和音频分支组成,并在模态之间进行交叉注意力。视频分支基于微调的ViT架构。音频分支提取梅尔频谱图,并通过CNN模块输入到Transformer编码器中。我们的训练范式包括一个生成的合成数据集,以数据驱动的方式提高模型对图像中面部表情的敏感性。大量实验证明了我们方法的重要性。我们的隐私合规方案在EmotiW挑战中表现良好,最佳模型在验证集和测试集上的准确率分别达到79.24%和75.13%。值得注意的是,我们的发现表明,仅使用视频上均匀分布的5帧,使用隐私合规特征即可达到这一准确率水平。
引用
@article{arxiv.2312.05265,
title = {Multimodal Group Emotion Recognition In-the-wild Using Privacy-Compliant Features},
author = {Anderson Augusma and Dominique Vaufreydaz and Frédérique Letué},
journal= {arXiv preprint arXiv:2312.05265},
year = {2023}
}