中文

PRISM:用于具身视觉语言模型的多视角多能力零售视频数据集

计算机视觉与模式识别 2026-04-01 v1 人工智能 机器人学

摘要

当前面向实际部署环境的结构化物理 AI 模型在一般性视觉理解方面存在显著差距,而其感知需求更为专业化。我们提出 PRISM,这是一个 27 万样本的多视角视频监督性微调 (SFT) 语料库,面向具身视觉语言模型 (VLM) 的实际零售环境。PRISM 的动机来自一个简单观察——物理 AI 系统之所以失败,不是因为视觉识别不佳,而是因为其对空间、物理动力学和具身动作的理解不足,以至于在实际世界中无法可靠地运行。为此,PRISM 建立在一个新颖的三维知识本体上,涵盖空间知识、时空和物理知识以及具身动作知识。它覆盖 20+ 项能力探针,跨越四个评估维度:具身推理 (ER)、常识 (CS)、空间感知 (SP) 和直觉物理 (IP),据我们所知,PRISM 是首个在单一实际部署领域实例化所有三维知识的 dataset。该语料库捕获来自 egocentric、exocentric 和 360{\deg} 视角的数据,覆盖五个超市场位置,包括开放式、链路思考和多选题监督。以 4 fps 的速度,PRISM 包含约 1180 万视频帧和约 7.3 亿 token,位列实际数据集中最大的领域特定视频 SFT 语料库。在 PRISM 上微调的模型在所有 20+ 项探针上的错误率降低 66.6%,在具身动作理解方面准确率提升 36.4%。我们的结果表明,基于本体结构的领域特定 SFT 可以显著强化面向实际场景的具身 VLM。PRISM 数据集及更多细节可在 https://dreamvu.ai/prism 获得。

关键词

引用

@article{arxiv.2603.29281,
  title  = {PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models},
  author = {Amirreza Rouhi and Parikshit Sakurikar and Satya Sai Reddy and Narsimha Menga and Anirudh Govil and Sri Harsha Chittajallu and Rajat Aggarwal and Anoop Namboodiri and Sashi Reddi},
  journal= {arXiv preprint arXiv:2603.29281},
  year   = {2026}
}