中文

R^3-VQA:通过视频社交推理“察言观色”

计算机视觉与模式识别 2025-05-08 v1 人工智能

摘要

“察言观色”是人类日常生活中的一项重要社交推理能力。人类能够从微妙的社交线索中推断他人的心理状态。以往的社交推理任务和数据集缺乏复杂性(例如场景简单、交互基础、心理状态变量不完整、单步推理等),远未达到现实社交互动中的挑战。在本文中,我们贡献了一个有价值、高质量且全面的视频数据集,名为 R^3-VQA,其中包含对复杂社交场景下的社交事件和心理状态(即信念、意图、欲望和情感)以及相应社交因果链的精确细粒度标注。此外,我们还包含了人工标注和模型生成的问答对。我们的任务 R^3-VQA 包括三个方面:社交事件理解、心理状态估计和社交因果推理。作为一个基准,我们全面评估了当前最先进的大型视觉-语言模型(LVLMs)的社交推理能力和一致性。综合实验表明:(i) 在复杂社交场景中,LVLMs 距离人类水平的一致性社交推理仍有很大差距;(ii) 心智理论(ToM)提示可以帮助 LVLMs 在社交推理任务上表现得更好。我们在补充材料中提供了部分数据集和代码,并将在录用后发布完整的数据集和代码。

关键词

引用

@article{arxiv.2505.04147,
  title  = {R^3-VQA: "Read the Room" by Video Social Reasoning},
  author = {Lixing Niu and Jiapeng Li and Xingping Yu and Shu Wang and Ruining Feng and Bo Wu and Ping Wei and Yisen Wang and Lifeng Fan},
  journal= {arXiv preprint arXiv:2505.04147},
  year   = {2025}
}