中文

视觉语言模型为何难以识别人类情绪?

计算机视觉与模式识别 2026-04-17 v1 人工智能

摘要

理解情绪是智能系统能够与人类交互的基本能力。视觉-语言模型 (VLMs) 在过去几年间在众多视觉任务上取得了巨大进展,可能为理解情绪提供了有前景的解决方案。然而,令人惊讶的是,即便是最先进的当代 VLMs 也难以识别人类情绪,甚至难以超越专门的视觉-only 分类器。在本文中,我们提出了问题:"视觉语言模型为何难以识别人类情绪?",并观察到面部表情识别 (DFER) 这一本质上连续且动态的任务暴露了两种关键 VLM 漏洞。首先,情绪数据集本质上是长尾分布,web 规模数据用于预训练 VLMs 加剧了这种 head-class 偏差,导致它们系统性地将罕见、缺乏代表性的情绪折叠到常见类别中。我们提出了防止偏好常见概念的替代抽样策略。其次,情绪理解至关重要。然而,VLMs 无法在密集帧序列上表示情绪信息,因为它们受限于上下文大小和内存中可容纳的标记数,这为情绪识别提出了明确的挑战。我们演示了 VLMs 所使用的稀疏时间抽样策略本质上与微表情 (0.25-0.5 秒) 的短暂性质不匹配——后者往往是最关键的情感信号。作为诊断探针,我们提出了一种多阶段 context enrichment 策略,通过首先将其转化为自然语言摘要来利用"中间"帧的信息。该增强文本上下文作为输入提供给 VLM 同时稀疏关键帧,防止过多视觉数据导致注意力稀释,同时保留情绪轨迹。

关键词

引用

@article{arxiv.2604.15280,
  title  = {Why Do Vision Language Models Struggle To Recognize Human Emotions?},
  author = {Madhav Agarwal and Sotirios A. Tsaftaris and Laura Sevilla-Lara and Steven McDonagh},
  journal= {arXiv preprint arXiv:2604.15280},
  year   = {2026}
}