中文

Extend3D:基于单张图像的城规模3D生成

计算机视觉与模式识别 2026-04-01 v1 人工智能

摘要

本文我们提出Extend3D,一个基于对象中心3D生成模型的单图像3D场景生成训练免费管线。为克服固定大小潜在空间用于表示宽广场景的局限,我们扩展了在x和y方向上的潜在空间。随后,将扩展后的潜在空间划分为重叠的补丁,分别应用对象中心3D生成模型并在每个时间步对其进行耦合。由于补丁级3D生成需要严格的图像与潜在补丁之间的空间对齐,因此我们使用单目深度估计器获取点云先验并通过SDEdit迭代细化遮挡区域。我们发现,将3D结构的不完整性视为噪声进行3D细化可实现3D完成,我们称之为under-noising。此外,为解决对象中心模型在子场景生成方面的次优,我们优化扩展后的潜在空间,以确保去噪轨迹与子场景动力学保持一致。为此,我们引入3D感知优化目标以提高几何结构和纹理保真度。我们通过人类偏好和量化实验证明,我们的方法优于先前方法。

关键词

引用

@article{arxiv.2603.29386,
  title  = {PromptForge-350k: A Large-Scale Dataset and Contrastive Framework for Prompt-Based AI Image Forgery Localization},
  author = {Jianpeng Wang and Haoyu Wang and Baoying Chen and Jishen Zeng and Yiming Qin and Yiqi Yang and Zhongjie Ba},
  journal= {arXiv preprint arXiv:2603.29386},
  year   = {2026}
}