VisualActBench:视觉语言模型能否像人类一样看和行动?
计算机视觉与模式识别
2026-01-06 v2
摘要
视觉语言模型(VLMs)在感知和描述视觉环境方面取得了令人瞩目的进展。然而,它们仅基于视觉输入进行主动推理和行动的能力,而无需显式文本提示,仍然探索不足。我们引入了一项新任务——视觉动作推理,并提出了 VisualActBench,一个大规模基准,包含 1,074 个视频和 3,733 个人类标注动作,涵盖四个真实场景。每个动作标注了动作优先级(APL)和主动-反应类型,以评估模型与人类对齐的推理和价值敏感性。我们在 VisualActBench 上评估了 29 个 VLMs,发现尽管前沿模型如 GPT-4o 展示了相对较强的性能,但在生成主动、高优先级动作方面,与人类水平推理之间仍存在显著差距。我们的结果揭示了当前 VLMs 在解释复杂情境、预测结果和与人类决策框架对齐方面的局限性。VisualActBench 为评估和改进主动、以视觉为中心的 AI 代理的现实就绪性建立了全面基础。
引用
@article{arxiv.2512.09907,
title = {VisualActBench: Can VLMs See and Act like a Human?},
author = {Daoan Zhang and Pai Liu and Xiaofei Zhou and Yuan Ge and Guangchen Lan and Jing Bi and Christopher Brinton and Ehsan Hoque and Jiebo Luo},
journal= {arXiv preprint arXiv:2512.09907},
year = {2026}
}