中文

基于法线对齐的视频扩散模型用于单图像到 3D 生成

计算机视觉与模式识别 2025-06-10 v1 人工智能

摘要

3D AI 生成内容(AIGC)已变得越来越易于每个人创建 3D 内容。虽然最近的方法利用得分蒸馏抽取 3D 对象,但往往受限于不足的 3D 先验,导致多视角一致性不足。本文引入 NOVA3D,一种创新的单图像到 3D 生成框架。我们的关键思想在于利用来自预训练视频扩散模型的强大 3D 先验,并在多视角视频微调期间整合几何信息。为促进颜色域和几何域之间的信息交换,我们提出了几何-时间对齐(GTA)注意力机制,从而提高了泛化性和多视角一致性。此外,我们引入去冲突几何融合算法,通过解决多视角不准确和姿态对齐差异,提高了纹理保真度。广泛的实验验证了 NOVA3D 优于现有基线的优势。

关键词

引用

@article{arxiv.2506.07698,
  title  = {NOVA3D: Normal Aligned Video Diffusion Model for Single Image to 3D Generation},
  author = {Yuxiao Yang and Peihao Li and Yuhong Zhang and Junzhe Lu and Xianglong He and Minghan Qin and Weitao Wang and Haoqian Wang},
  journal= {arXiv preprint arXiv:2506.07698},
  year   = {2025}
}

备注

8 pages, 7 figures, accepted by ICME 2025