中文

Lotus-2:利用强大图像生成模型推进几何稠密预测

计算机视觉与模式识别 2026-05-19 v3

摘要

从单张图像恢复像素级几何属性在 appearance 模糊和 2D 观察与 3D 结构之间的非单射映射下是根本不确定的。虽然判别回归模型通过大规模监督实现了强大的性能,但其成功受限于可用数据的规模、质量和多样性,以及有限的物理推理。最近的扩散模型表现出来自大规模图像-文本数据的几何和语义学习的强大世界先验,但直接重用其随机生成公式不适用于确定性几何推断:前者优化的是多样性和高保真图像生成,而后者需要稳定和准确的预测。在本文中,我们提出 Lotus-2,一个两个阶段的确定性框架,用于稳定、准确和细粒度的几何稠密预测,旨在为充分利用预训练生成先验提供最佳适应协议。具体而言,在第一个阶段,核心预测器采用单步骤确定性公式,配合干净数据目标和轻量级局部连续性模块 (LCM),生成全局一致的结构而无网格伪影。在第二个阶段,细节锐化器在核心预测器定义的流形上执行受约束的多步骤 rectified-flow 细化,通过无噪声确定性流匹配增强细粒度几何。仅使用 59K 训练样本,远少于现有大规模数据集的 1%,Lotus-2 在单目深度估计和高度具竞争力的表面法线预测中建立了新的状态-of-the-art 结果。这些结果表明,扩散模型可作为确定性世界先验,使几何推理超越传统判别和生成范式。

关键词

引用

@article{arxiv.2512.01030,
  title  = {Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model},
  author = {Jing He and Haodong Li and Mingzhi Sheng and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2512.01030},
  year   = {2026}
}

备注

v3: Fixed some typos. Project page: https://lotus-2.github.io/