中文

Edit-As-Act:面向开放词汇表 3D 室内场景编辑的目标回归规划

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

从自然语言编辑 3D 室内场景在概念上是直接的,但在技术上具有挑战性。现有的开放词汇表系统常会重新生成场景的大部分内容,或依赖图像空间编辑破坏空间结构,导致意外的全局变更或物理不一致的布局。这些限制源于将编辑主要视为生成任务的做法。我们采取不同的视角:用户指令定义了 desired world state,而编辑应是在保持其他内容不变的前提下,使该状态成为真所需的最小动作序列。此视角动机下,Edit-As-Act 框架将开放词汇表场景编辑视为 3D 空间中的目标回归规划。给定源场景和 free-form 指令,Edit-As-Act 预测符号 goal predicates,并在我们设计的 EditLang(受 PDDL 启发的动作语言)中进行规划,该语言包含显式 precondition 和 effect,编码 support、contact、collision 等几何关系。语言驱动的规划器提出动作,validator 确保 goal-directedness、monotonicity 和 physical feasibility,从而产生可解释且物理连贯的转换。通过将推理与低层生成分离,Edit-As-Act 实现了 instruction fidelity、semantic consistency 和 physical plausibility —— 三项现有范例无法同时满足的准则。在 E2A-Bench 上,我们的基准包含 63 个跨 9 个室内环境的编辑任务,Edit-As-Act 在所有编辑类型和场景类别中均显著优于先前方法。

关键词

引用

@article{arxiv.2603.17583,
  title  = {Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing},
  author = {Seongrae Noh and SeungWon Seo and Gyeong-Moon Park and HyeongYeop Kang},
  journal= {arXiv preprint arXiv:2603.17583},
  year   = {2026}
}

备注

Accepted to CVPR 2026