中文

SeeThrough3D:基于遮挡的文本到图像 3D 控制

计算机视觉与模式识别 2026-02-27 v1 人工智能

摘要

我们识别出遮挡推理是 3D 布局条件生成中一个基本却被忽视的方面。它对于合成具有深度一致几何和尺度的部分遮挡对象至关重要。虽然现有方法可生成遵循输入布局的逼真场景,但往往无法建模精确的物体间遮挡。我们提出 SeeThrough3D,一种显式建模遮挡的 3D 布局条件生成模型。我们引入一种遮挡感知 3D 场景表示(OSCR),其中将物体 depicted 为置于虚拟环境内的半透明 3D 盒子,并从所需摄像机视角进行渲染。透明度编码隐藏物体区域,使模型能够推理遮挡关系,而渲染视角提供生成过程中的显式摄像机控制。我们通过引入由渲染 3D 表示派生的视觉标记,对预训练的基于流的文本到图像生成模型进行条件化。此外,我们应用掩码自注意力机制准确地将每个物体边界框绑定到其对应的文本描述,从而实现对多个物体的准确生成,避免属性混合。为训练该模型,我们构建了一个包含多样化多物体场景且具有强遮挡关系的合成数据集。SeeThrough3D 能有效推广至未见物体类别,实现具有真实遮挡和一致摄像机控制的精确 3D 布局控制。

关键词

引用

@article{arxiv.2602.23359,
  title  = {SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation},
  author = {Vaibhav Agrawal and Rishubh Parihar and Pradhaan Bhat and Ravi Kiran Sarvadevabhatla and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:2602.23359},
  year   = {2026}
}

备注

Project page: https://seethrough3d.github.io. Accepted at CVPR 2026