中文

视觉空间认知助手

计算机视觉与模式识别 2025-09-10 v4 人工智能 计算与语言 机器学习 机器人学

摘要

基于视频的空间认知对机器人和具身 AI 至关重要,但挑战当前的视觉语言模型(VLM)。本文做出两大贡献。首先,我们引入 ViCA (Visuospatial Cognitive Assistant)-322K,一个来自真实世界室内视频(ARKitScenes、ScanNet、ScanNet++)的 322,003 对 QA 对的多样化数据集,为 3D 元数据驱动查询和视频-based 复杂推理提供监督。其次,我们开发 ViCA-7B,在 ViCA-322K 上微调,实现对所有八个 VSI-Bench 任务的全新状态-of-the-art 性能,超越现有模型,包括更大规模模型(例如在绝对距离上提升 26.1)。为了提高可解释性,我们呈现 ViCA-Thinking-2.68K,一个包含显式推理链的数据集,并在 ViCA-7B 上微调以创建 ViCA-7B-Thinking,一个能阐述其空间推理的模型。我们的工作凸显了针对性数据和改进时空建模路径的重要性。我们将发布所有资源以促进稳健的视觉空间智能研究。

关键词

引用

@article{arxiv.2505.12312,
  title  = {Visuospatial Cognitive Assistant},
  author = {Qi Feng},
  journal= {arXiv preprint arXiv:2505.12312},
  year   = {2025}
}

备注

31 pages, 10 figures, 6 tables