中文

情感的解剖:通过大视觉-语言模型叙述具身情绪

计算与语言 2025-09-25 v1 计算机视觉与模式识别

摘要

身体部位对情绪反应的具身化包含了我们情感体验的丰富信息。我们提出了一个框架,利用最先进的大视觉-语言模型 (LVLMs) 来生成具身 LVLM 情绪叙述 (ELENA)。这些是定义明确的多层次文本输出,主要包含聚焦于情绪反应中涉及的关键身体部位的描述。我们还使用了注意力图,并观察到当代模型对面部区域表现出持续的偏好。尽管存在这一局限性,我们发现所采用的框架能够有效识别面部被遮挡图像中的具身情绪,在无需任何微调的情况下性能优于基线模型。ELENA 为跨视觉模态的具身情绪分析开辟了新路径,并丰富了情感感知环境下的建模。

引用

@article{arxiv.2509.19595,
  title  = {Anatomy of a Feeling: Narrating Embodied Emotions via Large Vision-Language Models},
  author = {Mohammad Saim and Phan Anh Duong and Cat Luong and Aniket Bhanderi and Tianyu Jiang},
  journal= {arXiv preprint arXiv:2509.19595},
  year   = {2025}
}