SpatialFusion:为统一图像生成内置内在3D几何感知能力
计算机视觉与模式识别
2026-04-30 v1
摘要
近期的统一图像生成模型通过采用 MLLMs 进行语义理解和扩散 backbone 进行图像生成,取得了显著的成功。然而,这些模型在空间感知任务中仍受限,由于缺乏内在的空间理解能力以及在生成过程中缺乏显式的几何指导。在本文中,我们提出了 SpatialFusion,一种将3D几何感知内置于统一图像生成模型中的新框架。具体而言,我们首先采用 Mixture-of-Transformers(MoT)架构,增强 MLLM 的平行空间 transformer,从而提升3D几何建模能力。通过与 MLLM 共享自注意力机制,空间 transformer 学习从丰富的语义上下文中推导出目标图像的度量深度图。这些显式几何脚手架随后通过一种专用的 depth adapter 注入扩散 backbone,为空间一致的图像生成提供精确的空间约束。通过分阶段两阶段训练策略,SpatialFusion 在空间感知基准测试上显著提升性能,尤其优于 GPT-4o 等领先模型。此外,它在文本到图像生成和图像编辑场景下均实现了普遍性能提升,同时保持了可忽略的推理开销。
引用
@article{arxiv.2604.26341,
title = {SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness},
author = {Haiyi Qiu and Kaihang Pan and Jiacheng Li and Juncheng Li and Siliang Tang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2604.26341},
year = {2026}
}