中文

将扩散模型重新用于通用密集感知任务时什么最重要?

计算机视觉与模式识别 2024-12-03 v4

摘要

大规模数据的广泛预训练对于下游几何和语义视觉感知任务是不可或缺的。得益于大规模文本到图像(T2I)预训练,近期的工作通过简单微调用于密集感知任务的T2I扩散模型展示了有希望的结果。然而,这一过程中的几个关键设计决策仍然缺乏全面的论证,包括多步随机扩散机制的必要性、训练策略、推理集成策略和微调数据质量。在这项工作中,我们对使用扩散先验时影响迁移效率和性能的关键因素进行了彻底调查。我们的主要发现是:1)高质量的微调数据对于语义和几何感知任务都至关重要。2)扩散模型的随机性对确定性视觉感知任务有轻微的负面影响。3)除了仅使用潜空间监督微调扩散模型外,任务特定的图像级监督有助于增强细粒度细节。这些观察促成了GenPercept的开发,这是一种为密集视觉感知任务量身定制的有效确定性单步微调范式。与以前的多步方法不同,我们的范式具有更快的推理速度,并且可以与定制的感知解码器和用于图像级监督的损失函数无缝集成,这对于改善预测的细粒度细节至关重要。在包括单目深度估计、表面法线估计、图像分割和抠图在内的各种密集视觉感知任务上进行了综合实验,以证明我们提出方法的显著适应性和有效性。

关键词

引用

@article{arxiv.2403.06090,
  title  = {What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?},
  author = {Guangkai Xu and Yongtao Ge and Mingyu Liu and Chengxiang Fan and Kangyang Xie and Zhiyue Zhao and Hao Chen and Chunhua Shen},
  journal= {arXiv preprint arXiv:2403.06090},
  year   = {2024}
}

备注

Code is at: https://github.com/aim-uofa/GenPercept