Marigold:面向图像分析的扩散模型图像生成器低成本适配
计算机视觉与模式识别
2025-05-15 v1 机器学习
摘要
过去十年中,深度学习在计算机视觉领域的成功依赖于大型标注数据集和强大的预训练模型。在数据稀缺的场景下,这些预训练模型的质量对于有效的迁移学习变得至关重要。图像分类和自监督学习传统上一直是预训练 CNN 和基于 Transformer 架构的主要方法。最近,文本到图像生成模型的兴起,特别是那些在潜空间中使用去噪扩散的模型,引入了一类在海量带字幕图像数据集上训练的新型基础模型。这些模型生成未见内容的逼真图像的能力表明,它们对视觉世界具有深刻的理解。在本工作中,我们提出了 Marigold,一组条件生成模型和一种微调协议,从预训练的潜扩散模型(如 Stable Diffusion)中提取知识,并将其适配于密集图像分析任务,包括单目深度估计、表面法线预测和内在分解。Marigold 仅需对预训练潜扩散模型的架构进行极小修改,在单 GPU 上使用小型合成数据集训练数天,并展现出最先进的零样本泛化能力。项目页面:https://marigoldcomputervision.github.io
引用
@article{arxiv.2505.09358,
title = {Marigold: Affordable Adaptation of Diffusion-Based Image Generators for Image Analysis},
author = {Bingxin Ke and Kevin Qu and Tianfu Wang and Nando Metzger and Shengyu Huang and Bo Li and Anton Obukhov and Konrad Schindler},
journal= {arXiv preprint arXiv:2505.09358},
year = {2025}
}
备注
Journal extension of our CVPR 2024 paper, featuring new tasks, improved efficiency, high-resolution capabilities, and enhanced accessibility