Lotus: 基于扩散的高质量密集预测视觉基础模型
计算机视觉与模式识别
2025-01-22 v5
摘要
利用预训练文本到图像扩散模型的视觉先验,为增强密集预测任务中的零样本泛化提供了一种有前景的解决方案。然而,现有方法往往不加批判地使用原始扩散公式,由于密集预测与图像生成之间存在根本差异,这可能并非最优。本文中,我们系统分析了密集预测的扩散公式,重点关注质量和效率。我们发现,用于图像生成的原始参数化类型(学习预测噪声)对密集预测有害;多步加噪/去噪扩散过程也非必要且难以优化。基于这些见解,我们引入了Lotus,一个基于扩散的视觉基础模型,采用简单而有效的密集预测适配协议。具体而言,Lotus被训练为直接预测标注而非噪声,从而避免有害方差。我们还将扩散过程重构为单步过程,简化了优化并显著提升了推理速度。此外,我们引入了一种名为细节保持器的新型调优策略,实现了更准确和细粒度的预测。在不扩大训练数据或模型容量的情况下,Lotus在各种数据集的零样本深度和法线估计中达到了SoTA性能。它还提升了效率,比大多数现有基于扩散的方法快得多。Lotus的卓越质量和效率还支持广泛的实际应用,如联合估计、单/多视图3D重建等。项目页面:https://lotus3d.github.io/。
引用
@article{arxiv.2409.18124,
title = {Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction},
author = {Jing He and Haodong Li and Wei Yin and Yixun Liang and Leheng Li and Kaiqiang Zhou and Hongbo Zhang and Bingbing Liu and Ying-Cong Chen},
journal= {arXiv preprint arXiv:2409.18124},
year = {2025}
}
备注
The first two authors contributed equally. Project page: https://lotus3d.github.io/