VIBE:VLM 能否读懂气氛?
计算机视觉与模式识别
2025-12-17 v2 机器学习
摘要
理解人类社会行为,如识别情绪和引发情绪的社会动态,是重要且具有挑战性的问题。尽管大语言模型(large language models, LLMs)取得了显著进展,但它们局限于文本领域,无法考虑非语言线索在理解社会情境中所起的主要作用。视觉语言模型(vision language models, VLMs)可能弥补这一差距,但其在对此类社交线索作出正确推断的能力受到很少关注。本文我们探索了VLMs在社交推理方面的能力。我们识别了一个被忽视的VLMs局限性:视觉社交语境推断缺口。为针对这一缺口,我们提出了VLMs的新任务:视觉社交语境推断。我们构建了一个高质量的数据集来测试VLMs在此任务上的能力,并对几种VLMs在其上的性能进行基准测试。
引用
@article{arxiv.2506.11162,
title = {VIBE: Can a VLM Read the Room?},
author = {Tania Chakraborty and Eylon Caplan and Dan Goldwasser},
journal= {arXiv preprint arXiv:2506.11162},
year = {2025}
}
备注
Findings of EMNLP, 2025