中文

GRASP:学习在多人物非言语交互中建立社会推理的基础

计算机视觉与模式识别 2026-05-18 v1 人工智能

摘要

理解社会交互需要对微妙的非言语线索进行推理,然而当前的多模态大语言模型(MLLM)常常无法识别多人视频中谁与谁在交互。我们引入了 GRASP,一个大规模的社会推理数据集,它将高层次的社会问答与细粒度的凝视和指示性手势事件联系起来。GRASP 包含 46K 个视频上的 290K 个问答对,总计 749 小时,按照一个涵盖凝视、手势以及凝视-手势联合推理的 16 类分类法进行组织,并附带用于评估的 GRASP-Bench。与先前专注于孤立线索或高层次社会问答的资源不同,GRASP 从身份一致的凝视轨迹、指示性手势以及它们在社会事件中的联合组合来构建问题。此外,我们提出了社会基础奖励(SGR),这是一种利用这些社会事件来鼓励模型对每个交互中涉及的参与者进行推理的学习信号。实验表明,SGR 提高了在 GRASP-Bench 上的性能,同时保持了在相关社会视频问答基准上的零样本性能。

关键词

引用

@article{arxiv.2605.15764,
  title  = {GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions},
  author = {Junho Kim and Xu Cao and Houze Yang and Bikram Boote and Ana Jojic and Fiona Ryan and Bolin Lai and Sangmin Lee and James M. Rehg},
  journal= {arXiv preprint arXiv:2605.15764},
  year   = {2026}
}

备注

Project page: https://social-reaoning.github.io/grasp/