中文

NormalCrafter:从视频扩散先验中学习时序一致的法线

计算机视觉与模式识别 2025-04-16 v1

摘要

表面法线估计是计算机视觉应用领域的基石。尽管已有大量工作聚焦于静态图像场景,但确保视频基于法线估计的时序一致性仍是巨大挑战。本文不仅为现有方法增添时序组件,而是提出 NormalCrafter,利用视频扩散模型内在的时序先验。为确保序列上高保真的法线估计,我们提出语义特征正则化(SFR),该方法将扩散特征与语义线索对齐,鼓励模型聚焦于场景的本质语义。此外,我们引入两阶段训练协议,利用潜在空间和像素空间的学习,既保留空间精度又维持长时序上下文。大量评估表明,我们方法的有效性,展示了在多样化视频中生成时序一致且细节丰富的法线序列的卓越性能。

关键词

引用

@article{arxiv.2504.11427,
  title  = {NormalCrafter: Learning Temporally Consistent Normals from Video Diffusion Priors},
  author = {Yanrui Bin and Wenbo Hu and Haoyuan Wang and Xinya Chen and Bing Wang},
  journal= {arXiv preprint arXiv:2504.11427},
  year   = {2025}
}

备注

9 pages, 6 figures, Project Page: https://normalcrafter.github.io/