中文

IDCNet:面向度量一致 RGBD 场景生成与精确相机控制的引导式视频扩散

计算机视觉与模式识别 2025-08-07 v1

摘要

我们提出了 IDC-Net(Image-Depth Consistency Network,图像-深度一致性网络),这是一种在显式相机轨迹控制下生成 RGB-D 视频序列的新型框架。与将 RGB 和深度生成分开处理的方法不同,IDC-Net 在统一的几何感知扩散模型内联合合成 RGB 图像及其对应的深度图。该联合学习框架增强了跨帧的空间与几何对齐,从而在生成的序列中实现更精确的相机控制。为了支持该相机条件模型的训练并确保高几何保真度,我们构建了一个相机-图像-深度一致的数据集,包含度量对齐的 RGB 视频、深度图和精确的相机位姿,提供了精确的几何监督并显著改善了帧间几何一致性。此外,我们引入了一个几何感知 Transformer 模块,可实现细粒度的相机控制,增强了对生成序列的控制能力。大量实验表明,IDC-Net 在生成场景序列的视觉质量和几何一致性方面均优于 SOTA 方法。值得注意的是,生成的 RGB-D 序列无需额外的后处理步骤即可直接用于下游 3D 场景重建任务,展示了我们联合学习框架的实际优势。更多内容请见 https://idcnet-scene.github.io。

关键词

引用

@article{arxiv.2508.04147,
  title  = {IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control},
  author = {Lijuan Liu and Wenfa Li and Dongbo Zhang and Shuo Wang and Shaohui Jiao},
  journal= {arXiv preprint arXiv:2508.04147},
  year   = {2025}
}

备注

10 pages, 7 figures