TIMI:基于空间保真的训练-free 图像到 3D 多实例生成
计算机视觉与模式识别
2026-03-03 v1
摘要
图像到 3D 多实例生成中精确的空间保真对于下游现实应用至关重要。最近的工作尝试通过在多实例数据集上微调预训练的图像到 3D(I23D)模型来解决此问题,但产生了巨大的训练开销,且难以保证空间保真。事实上,我们注意到预训练的 I23D 模型已经具备有意义的空间先验,但这些先验因未被充分利用而导致实例缠绕问题。鼓励此发现的基础上,我们提出了 TIMI(Training-free Image-to-3D Multi-Instance),一个实现高空间保真的训练-free 框架,用于图像到 3D 多实例生成。具体而言,我们首先引入实例感知分离指导(ISG)模块,促进早期去噪阶段的实例解耦。随后,为稳定由 ISG 引入的指导,我们设计了空间稳定几何自适应更新(SGU)模块,以保持实例相对关系的同时维持其几何特征的保存。广泛的实验表明,我们的方法在不 requiring additional training 的情况下,在全局布局和 distinct local instances 方面优于现有的多实例方法,并且推理速度更快。
引用
@article{arxiv.2603.01371,
title = {TIMI: Training-Free Image-to-3D Multi-Instance Generation with Spatial Fidelity},
author = {Xiao Cai and Lianli Gao and Pengpeng Zeng and Ji Zhang and Heng Tao Shen and Jingkuan Song},
journal= {arXiv preprint arXiv:2603.01371},
year = {2026}
}