中文

SIV-Bench:用于社交互动理解与推理的视频基准测试

计算机视觉与模式识别 2026-04-29 v3 人工智能

摘要

社交互动理解涵盖感知众多细微的多模态线索、推断不可观测的心理状态与关系,以及动态预测他人行为,是实现人机交互的基础。尽管多模态大语言模型(MLLM)在快速进步,但社交互动的复杂性与多面性阻碍了构建全面评估其社交互动能力的基准测试。基于广泛视为理解社交行为基础框架的社交关系理论,我们提供了SIV-Bench——一个系统评估 MLLM 在社交场景理解(SSU)、社交状态推理(SSR)和社交动态预测(SDP)方面能力的新型视频基准测试。SIV-Bench 包含 2,792 个原创收集的视频片段和 5,455 对来自人类-LLM 协作管道精心生成的问答对,涵盖 14 种典型关系、多样视频时长、类型、呈现方式以及语言和文化背景。我们的实验表明,领先的 MLLM 在 SSU 上表现相对良好,但在 SSR 和 SDP 上仍显薄弱,关系推断中的系统性混淆是关键瓶颈。对推理过程的深入分析表明,MLLM 的绩效不佳源于与人类思维方式不一致以及推理深度不足。此外,我们发现音频和字幕有助于推理密集型的 SSR 和 SDP。总之,SIV-Bench 提供了一个统一的测试平台,用于衡量进展、暴露局限性,并指导未来研究 toward 更具社交智能的 MLLM。我们将在项目网站发布数据集和代码:https://kfq20.github.io/sivbench。

关键词

引用

@article{arxiv.2506.05425,
  title  = {SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning},
  author = {Fanqi Kong and Weiqin Zu and Xinyu Chen and Yaodong Yang and Song-Chun Zhu and Xue Feng},
  journal= {arXiv preprint arXiv:2506.05425},
  year   = {2026}
}