通过场景自探索进行视角规划
人工智能
2026-05-29 v1 计算机视觉与模式识别
机器人学
摘要
VLMs 是否能够预测每一次摄像机移动如何改变视角,并提前规划多次此类移动?我们将这种能力称为视角规划,要求(1)理解单个动作如何转换视角,(2)在多轮计划中组合这些转换以识别目标视角。我们在提出的 ViewSuite 中对这两种能力进行探测,这是一个基于真实 ScanNet 场景的 3D 点云环境。 在 13 个前沿 VLMs 中发现,关键规划差距:它们拥有基础的视角-动作知识,但无法在跨多轮计划中进行组合,随着视点距离的增大,这一差距也随之扩大。为弥合这一差距,我们提出了一个迭代框架,交替进行自探索和视角图蒸馏。关键洞察是,无论探索轨迹的成败,所有探索轨迹共同构成了一个紧凑地捕获场景中视点如何相互连接的视角图。将这个图蒸馏为多样化的监督任务可重塑策略分布,克服纯 RL 受稀疏奖励导致的停滞。 这将 Qwen2.5-VL-7B 在交互式视角规划上的成绩从 2.5% 提升至 47.8%,超越 GPT-5.4 Pro(18.5%)和 Gemini 3.1 Pro(21.4%)。自探索似乎是通向 VLMs 能够在 3D 空间中主动推理和规划的有前景的道路。
引用
@article{arxiv.2605.29563,
title = {Planning with the Views via Scene Self-Exploration},
author = {Kangrui Wang and Linjie Li and Zhengyuan Yang and Shiqi Chen and Zihan Wang and Li Fei-Fei and Jiajun Wu and Leonidas Guibas and Lijuan Wang and Manling Li},
journal= {arXiv preprint arXiv:2605.29563},
year = {2026}
}