ReVSI:为准确评估 VLM 3D 推理重建视觉空间智能评估
计算机视觉与模式识别
2026-05-07 v2
摘要
当前的空间智力评估在现代视觉语言模型 (VLM) 设置下存在系统性无效性。首先,许多基准测试从基于点云的 3D 注释中派生问答对,这些注释最初是为传统 3D 感知精选的。当此类注释被用作基于视频的评估基准时,重建和注释制作中的人工缺失可见目标、误标对象身份或破坏几何相关答案(例如尺寸),导致错误或模糊的问答对。其次,评估常假设对整个场景的访问权限,而许多 VLM 仅 operates on 稀疏抽样的帧(例如 16-64),使得许多问题在实际模型输入下难以实现。我们通过引入 ReVSI,一个确保每个问答对在模型实际输入下可实现且正确的基准和协议来提高评估的有效性。为此,我们重新标注 5 个数据集中 381 个场景中的目标和几何,以提高数据质量,并使用严格的偏差缓解和专业 3D 注释工具进行人工验证重新生成所有问答对。我们进一步通过提供多个帧预算 (16/32/64/全部) 和细粒度目标可见性元数据来增强评估可控性。对 ReVSI 上通用和领域特定 VLM 的评估揭示了先前基准掩盖的系统性失效模式,提供了更可靠和诊断性的空间智力评估。
引用
@article{arxiv.2604.24300,
title = {ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning},
author = {Yiming Zhang and Jiacheng Chen and Jiaqi Tan and Yongsen Mao and Wenhu Chen and Angel X. Chang},
journal= {arXiv preprint arXiv:2604.24300},
year = {2026}
}
备注
ICML 2026, Project Page: https://3dlg-hcvc.github.io/revsi/