SVBench:用于评估视频生成模型社会推理能力的基准
计算机视觉与模式识别
2026-04-01 v5
摘要
最近的文本到视频生成模型在视觉逼真度、运动保真度和文本视频对齐方面取得了显著进展,但仍然难以生成社会上连贯的行为。与人类能够从简短的视觉线索推断意图、信念、情感和社会规范不同,当前模型常常生成字面场景,却未能捕捉潜在的因果和心理动态。为系统评估这一局限性,我们介绍了第一个针对视频生成社会推理的基准测试。该基准依据发展心理学和社会心理学,涵盖三十个经典社会认知范式,涉及七个核心维度:心理状态推断、目标导向行为、联合注意、社会协调、利他行为、社会规范和多智能体策略。为实现这些范式,我们构建了一个完全无需训练的基于智能体的管线,该管线提炼每个范式的推理结构,合成多样化的视频就绪场景,通过线索化验确保概念中性和难度控制,并运用高容量视觉语言模型 judge 依据五个可解释的社会推理维度评估生成视频。借助该框架,我们对七个最先进的视频生成系统进行了首次大规模评估。结果表明,表面层面的可信度与更深层的社会推理之间存在明显差距,表明当前模型在生成社会上具身化行为方面的能力仍有局限。https://github.com/Gloria2tt/SVBench-Evaluation
引用
@article{arxiv.2512.21507,
title = {SVBench: Evaluation of Video Generation Models on Social Reasoning},
author = {Wenshuo Peng and Gongxuan Wang and Tianmeng Yang and Chuanhao Li and Xiaojie Xu and Hui He and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2512.21507},
year = {2026}
}
备注
10pages