GPT-4V with Emotion: 广义情感识别的零样本基准
计算机视觉与模式识别
2024-03-19 v3 多媒体
摘要
最近,GPT-4 with Vision (GPT-4V) 在各种任务中展示了卓越的视觉能力,但其在情感识别方面的表现尚未得到充分评估。为填补这一空白,我们在涵盖6个任务的21个基准数据集上展示了GPT-4V的定量评估结果:视觉情感分析、推文情感分析、微表情识别、面部情感识别、动态面部情感识别和多模态情感识别。本文将这些任务统称为“广义情感识别(GER)”。通过实验分析,我们观察到GPT-4V在GER任务中表现出强大的视觉理解能力。同时,GPT-4V显示出整合多模态线索和利用时间信息的能力,这对情感识别也至关重要。然而,值得注意的是,GPT-4V主要针对通用领域设计,无法识别需要专业知识的微表情。据我们所知,本文首次对GPT-4V在GER任务上进行了定量评估。我们已开源代码,并鼓励后续研究者通过包含更多任务和数据集来拓宽评估范围。我们的代码和评估结果可在 https://github.com/zeroQiaoba/gpt4v-emotion 获取。
引用
@article{arxiv.2312.04293,
title = {GPT-4V with Emotion: A Zero-shot Benchmark for Generalized Emotion Recognition},
author = {Zheng Lian and Licai Sun and Haiyang Sun and Kang Chen and Zhuofan Wen and Hao Gu and Bin Liu and Jianhua Tao},
journal= {arXiv preprint arXiv:2312.04293},
year = {2024}
}