中文

学习现实中的具身意识

计算机视觉与模式识别 2026-02-19 v1

摘要

人类感知的核心方面是具身意识, 即将自身与周围物理环境关联起来并对可能的行动在语境中进行推理的能力。然而, 大多数现有针对多模态基础模型 (MFM) 的基准测试强调环境中心的空间关系 (场景中对象之间的关系), 大幅忽略需要相对于主体视点、姿态和运动进行推理的观察者中心关系。为弥合这一差距, 我们引入 SAW-Bench (具身意识于现实世界), 用于评估基于真实世界视频的外显具身意识的新基准。SAW-Bench 包含 786 个自制视频, 使用 Ray-Ban Meta (Gen 2) 智能眼镜拍摄, 覆盖多样化的室内外环境, 并包含 2,071 组人工标注的问答对。它探测模型的观察者中心理解, 包含六种不同的意识任务。我们的全面评估显示, 即使是最佳表现的 MFM, 如 Gemini 3 Flash, 与人类模型的性能差距也达 37.66%。除了这一差距, 我们深入分析揭示了若干值得注意的发现; 例如, 虽然模型可利用外显视频中的部分几何线索, 但它们往往无法推断出连贯的相机几何, 从而导致系统性的空间推理错误。我们将 SAW-Bench 定位为具身空间智能的基准, 超越被动观察, 理解以物理为基础的、以观察者为中心的动态。

关键词

引用

@article{arxiv.2602.16682,
  title  = {Learning Situated Awareness in the Real World},
  author = {Chuhan Li and Ruilin Han and Joy Hsu and Yongyuan Liang and Rajiv Dhawan and Jiajun Wu and Ming-Hsuan Yang and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2602.16682},
  year   = {2026}
}