中文

扩散模型用于光流与单目深度估计的惊人有效性

计算机视觉与模式识别 2023-12-07 v2

摘要

去噪扩散概率模型以其令人惊叹的保真度与多样性改变了图像生成。我们展示它们同样擅长估计光流与单目深度,令人惊讶的是,无需这些任务盛行的任务专用架构与损失函数。相较常规基于回归方法的逐点估计,扩散模型还支持蒙特卡洛推断,例如捕捉光流与深度中的不确定性与歧义。通过自监督预训练、合成与真实数据联合监督训练、处理含噪不完整训练数据的技术创新(填充与步展开去噪扩散训练)以及一种简单由粗至精细化形式,可训练出用于深度与光流估计的先进扩散模型。大量实验聚焦于针对基准的定量性能、消融研究,以及模型捕捉不确定性与多模态、填补缺失值的能力。我们的模型 DDVM(Denoising Diffusion Vision Model)在 NYU 室内基准上取得 0.074 的先进相对深度误差,在 KITTI 光流基准上取得 3.26\% 的 Fl-all 离群率,约优于最佳已发表方法 25\%。概览见 https://diffusion-vision.github.io。

关键词

引用

@article{arxiv.2306.01923,
  title  = {The Surprising Effectiveness of Diffusion Models for Optical Flow and Monocular Depth Estimation},
  author = {Saurabh Saxena and Charles Herrmann and Junhwa Hur and Abhishek Kar and Mohammad Norouzi and Deqing Sun and David J. Fleet},
  journal= {arXiv preprint arXiv:2306.01923},
  year   = {2023}
}

备注

NeurIPS 2023 (Oral)