SceneReVis:基于多轮强化学习的自反思视觉 grounding 框架用于 3D 室内场景合成
计算机视觉与模式识别
2026-02-11 v1
摘要
当前的一遍式 3D 场景合成方法常因缺乏深入推理而受制于空间幻觉问题,如碰撞等。为弥合这一差距,我们引入 SceneReVis,一个视觉 grounding 的自反思框架,采用迭代的“诊断-行动”循环,通过多模态反馈显式拦截和解决空间冲突。为支撑此分步范式,我们构建了 SceneChain-12k,一个通过新颖逆向工程管道派生的因果构建轨迹大规模数据集。我们进一步提出了两阶段训练配方,从监督微调过渡到代理式强化学习,使模型演化为主动空间规划器。大量实验表明,SceneReVis 在高保真生成和目标导向优化方面实现了最先进的性能,并对长尾领域表现出稳健的泛化能力。
引用
@article{arxiv.2602.09432,
title = {SceneReVis: A Self-Reflective Vision-Grounded Framework for 3D Indoor Scene Synthesis via Multi-turn RL},
author = {Yang Zhao and Shizhao Sun and Meisheng Zhang and Yingdong Shi and Xubo Yang and Jiang Bian},
journal= {arXiv preprint arXiv:2602.09432},
year = {2026}
}