中文

感知-规划:基于布局的单目 3D 场景布局估计

计算机视觉与模式识别 2026-05-26 v1

摘要

从单张图像构建结构化的 3D 场景布局需要在视觉观察与物理和空间约束之间进行协调,这是一种难以通过直接预测来解决的挑战。在本工作中,我们将单目 3D 布局估计形式化为一个以视觉-语言模型为导向的感知-规划问题,其中 Perceiver 首先对 3D 对象进行 grounding,然后 Planner 通过改善物理合理性的同时保持与输入图像一致性的方式迭代细化场景假设。我们提出 Layout-as-Policy (LaP),将规划阶段作为策略学习问题:将 3D 布局表示为结构化状态,并通过平移、旋转和缩放等离散动作进行细化。从几何增强 Perceiver 的观察对齐初始化开始,LaP Planner 经过训练可产生逐步解决几何不一致并强制实现真实空间关系的动作序列。为有效学习,我们结合监督轨迹初始化和偏好优化,使模型能够在无需显式奖励工程的情况下学习纠正行为。这种表述将布局估计从一个一次性预测任务转化为迭代细化过程,使其能够更好地处理全局约束和复杂对象相互作用。实验表明,我们的方法产生的布局在物理一致性和与视觉观察的对齐度方面更好,同时自然支持场景编辑和操纵等下游任务。

关键词

引用

@article{arxiv.2605.25326,
  title  = {Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation},
  author = {Junwei Zhou and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2605.25326},
  year   = {2026}
}

备注

21 pages