中文

MeshFormer:基于三维引导重建模型的高质量网格生成

计算机视觉与模式识别 2024-08-20 v1 图形学

摘要

开放世界三维重建模型最近获得了广泛关注。然而,由于缺乏足够的三维归纳偏置,现有方法通常需要昂贵的训练成本,并且难以提取高质量的三维网格。在本工作中,我们引入了MeshFormer,一个稀疏视角重建模型,明确利用三维原生结构、输入引导和训练监督。具体而言,我们不是使用三平面表示,而是将特征存储在三维稀疏体素中,并将Transformer与三维卷积相结合,以利用显式的三维结构和投影偏置。除了稀疏视角RGB输入外,我们还要求网络接收输入并生成对应的法线图。输入法线图可以由二维扩散模型预测,极大地辅助了几何学习的引导和细化。此外,通过结合有符号距离函数(SDF)监督与表面渲染,我们直接学习生成高质量网格,而无需复杂的多阶段训练过程。通过纳入这些显式的三维偏置,MeshFormer可以高效训练并提供具有细粒度几何细节的高质量纹理网格。它还可以与二维扩散模型集成,以实现快速的单图像到三维和文本到三维任务。项目页面:https://meshformer3d.github.io

关键词

引用

@article{arxiv.2408.10198,
  title  = {MeshFormer: High-Quality Mesh Generation with 3D-Guided Reconstruction Model},
  author = {Minghua Liu and Chong Zeng and Xinyue Wei and Ruoxi Shi and Linghao Chen and Chao Xu and Mengqi Zhang and Zhaoning Wang and Xiaoshuai Zhang and Isabella Liu and Hongzhi Wu and Hao Su},
  journal= {arXiv preprint arXiv:2408.10198},
  year   = {2024}
}

备注

20 pages, 9 figures