中文

Buffer Anytime:基于图像先验的零-shot视频深度与法线估计

计算机视觉与模式识别 2024-11-27 v1 人工智能

摘要

我们提出了Buffer Anytime,一个用于从视频估计深度和法线图(我们称为几何缓冲区)的框架,无需配对video-depth和video-normal训练数据。不依赖于大规模标注视频数据集,我们通过利用单张图像先验和时序一致性约束实现高质量的视频缓冲区估计。我们的零shot训练策略结合基于光流平滑性的先进图像估计模型,通过轻量级时序注意力架构实现混合损失函数。应用于像Depth Anything V2和Marigold-E2E-FT这样的领先图像模型,我们的方法在保持准确性的同时显著提高了时序一致性。实验表明,我们的方法不仅优于基于图像的方法,还即使在不使用任何配对视频数据的情况下,也能达到与大规模配对视频数据集训练的领先视频模型相当的效果。

关键词

引用

@article{arxiv.2411.17249,
  title  = {Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors},
  author = {Zhengfei Kuang and Tianyuan Zhang and Kai Zhang and Hao Tan and Sai Bi and Yiwei Hu and Zexiang Xu and Milos Hasan and Gordon Wetzstein and Fujun Luan},
  journal= {arXiv preprint arXiv:2411.17249},
  year   = {2024}
}