DICEPTION:面向视觉感知任务的通用扩散模型
计算机视觉与模式识别
2025-10-10 v3
摘要
本文的主要目标是开发一个鲁棒的通用感知模型,能够在计算资源有限和训练数据受限的约束下处理多种任务。我们利用在数十亿张图像上预训练的文本到图像扩散模型,成功推出了我们的DICEPTION,一个视觉通用模型。详尽的评估表明,DICEPTION能有效处理多样的感知任务,甚至达到了与SOTA单任务专家模型相当的性能。具体而言,我们仅使用其0.06%的数据(例如,600K对比1B像素级标注图像)就取得了与SAM-vit-h相当的结果。我们设计了关于架构和输入范式的全面实验,证明将单一扩散模型成功重新用于多种感知任务的关键在于最大限度地保留预训练模型的先验知识。因此,与需要从头开始训练的传统模型相比,DICEPTION的训练计算成本大幅降低。此外,将DICEPTION适应于新任务非常高效,只需在少至50张图像上进行微调,并调整约1%的参数。最后,我们证明,无分类器引导的巧妙应用可以提高模型在深度和法线估计上的性能。我们还表明,作为感知任务特征的像素对齐训练,显著增强了模型保留精细细节的能力。DICEPTION提供了有价值的见解,并为开发基于扩散的先进视觉通用模型展现了一个有前景的方向。代码和模型:https://github.com/aim-uofa/Diception
引用
@article{arxiv.2502.17157,
title = {DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks},
author = {Canyu Zhao and Yanlong Sun and Mingyu Liu and Huanyi Zheng and Muzhi Zhu and Zhiyue Zhao and Hao Chen and Tong He and Chunhua Shen},
journal= {arXiv preprint arXiv:2502.17157},
year = {2025}
}
备注
Homepage: https://aim-uofa.github.io/Diception, Code and Model: https://github.com/aim-uofa/Diception