评估视觉语言模型用于情感识别的能力
计算机视觉与模式识别
2025-02-11 v1 计算与语言
摘要
大型视觉语言模型 (VLMs) 在多个客观多模态推理任务中取得了显著的成功。然而,为了进一步提升其与人类进行同理和有效沟通的能力,提高 VLMs 处理和理解情感的能力至关重要。尽管在改进情感理解方面获得了大量研究关注,但缺乏对 VLMs 在情感相关任务上的详细评估,这可能会有助于 inform downstream fine-tuning 努力。在本工作中,我们呈现了对 VLMs 进行情感识别评估的首次全面评估。我们创建了一个用于 evoked emotion recognition 任务的基准数据集,并从正确性和鲁棒性的角度研究了 VLMs 在该任务上的表现。通过多项实验,我们展示了情感识别性能依赖的重要因素,并描述了 VLMs 在过程中所犯的各种错误。最后,我们通过人类评估研究指出了导致这些错误的潜在原因。我们使用实验结果为 VLMs 情感研究的未来提供了建议。
引用
@article{arxiv.2502.05660,
title = {Evaluating Vision-Language Models for Emotion Recognition},
author = {Sree Bhattacharyya and James Z. Wang},
journal= {arXiv preprint arXiv:2502.05660},
year = {2025}
}
备注
Accepted to NAACL 2025 Findings