使用大型多模态模型进行面部图像零样态情绪标注:基准测试与多类多帧方法的前景
计算机视觉与模式识别
2025-08-13 v2 人工智能
人机交互
机器学习
摘要
本研究探讨了利用大型多模态模型(LMM)自动标注日常场景中人类情绪的可行性和性能。我们在可公开获取的 FERV39k 数据集的 DailyLife 子集上进行实验,采用 GPT-4o-mini 模型对从视频片段中提取的关键帧进行快速零样态标注。在七类情绪分类体系下("生气"、"厌恶"、"恐惧"、"快乐"、"中性"、"悲伤"、"惊讶"),LMM 的平均精度约为 50%。相比之下,在情绪三分类(负/中/正)下,平均精度提升至约 64%。此外,我们还探索了一种将 1-2 秒视频片段中的多个帧整合以增强标注性能并降低成本的策略。结果表明,这种方法可稍微提高标注准确性。总体而言,我们的初步发现凸显了零样态 LMM 在人脸情绪标注任务中的潜在应用前景,为减少标注成本并拓宽 LMM 在复杂多模态环境中的适用性提供了新途径。
引用
@article{arxiv.2502.12454,
title = {Zero-shot Emotion Annotation in Facial Images Using Large Multimodal Models: Benchmarking and Prospects for Multi-Class, Multi-Frame Approaches},
author = {He Zhang and Xinyi Fu},
journal= {arXiv preprint arXiv:2502.12454},
year = {2025}
}
备注
10 pages, accepted to MRAC'25: 3rd International Workshop on Multimodal and Responsible Affective Computing (ACM-MM 2025)