PRISM:面向程序化时空推理的基准测试
人工智能
2026-05-20 v1
摘要
程序化视频生成通过代码实现,可提供像素级扩散模型超越的几何精度和时序一致性,但严格评估语言模型是否能生成时空正确的动画输出仍是未开发问题。我们引入 PRISM,一个规模为 10,372 对人类校准的指令-代码配对(约 20 倍大于以往程序化视频生成基准),基于真实世界知识可视化场景跨中英两种语言,覆盖 437 个学科类别。我们进一步提出一种漏斗式评估框架,包含四个互补指标:Code-Level Reliability 用于 executability,Spatial Reasoning 用于完整动画序列的布局正确性,以及 Prompt-Aware Dynamic Visual Complexity(PADVC)和 Temporal Density(TD)用于诊断动态表达和时序活动。对七主流 LLM 进行系统评估,发现惊人的 Execution-Spatial Gap:从执行成功率到时空通过率平均下降约 41%,表明可运行代码不一定产生时空连贯的视觉输出。这一发现表明,程序化视频生成评估应超越可执行性。PRISM 为推进时空连贯代码生成提供了原则性基准。
引用
@article{arxiv.2605.19382,
title = {PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning},
author = {Qiran Zhang and Yuheng Wang and Runde Yang and Lin Wu and Jingru Fan and Shu Yao and Jie Zhang and Tianle Zhou and Huatao Li and Ruijie Shi and Yihan Li and Chen Qian},
journal= {arXiv preprint arXiv:2605.19382},
year = {2026}
}