中文

DepthCrafter:为开放场景视频生成一致的长深度序列

计算机视觉与模式识别 2024-12-02 v2 人工智能 图形学

摘要

在开放场景中估计视频深度具有挑战性,由于视频在外观、内容运动、相机运动和长度方面的多样性。我们提出 DepthCrafter,一种 innovative 方法,用于生成开放世界视频的持久一致的长深度序列,无需任何额外信息如相机姿态或光流。通过从预训练的图像到视频扩散模型进行训练,通过严格设计的三阶段训练策略,实现了对开放世界视频的广泛泛化能力。我们的训练方法使模型能够一次性生成长度可变的深度序列,最长可达 110 帧,并从真实和合成数据集中提取精确的深度细节和丰富的内容多样性。我们还提出了一种可以在段落级别进行估计并无缝拼接的推理策略,以处理极长视频。多个数据集上的全面评估表明,DepthCrafter 在零样设置下实现了开放世界视频深度估计的领先性能。此外,DepthCrafter 促进了各种下游应用,包括基于深度的视觉特效和条件视频生成。

关键词

引用

@article{arxiv.2409.02095,
  title  = {DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos},
  author = {Wenbo Hu and Xiangjun Gao and Xiaoyu Li and Sijie Zhao and Xiaodong Cun and Yong Zhang and Long Quan and Ying Shan},
  journal= {arXiv preprint arXiv:2409.02095},
  year   = {2024}
}

备注

Project webpage: https://depthcrafter.github.io