中文

BlockFusion:利用潜在三平面外推的可扩展三维场景生成

计算机视觉与模式识别 2024-05-27 v4 人工智能 图形学

摘要

我们提出了 BlockFusion,这是一种基于扩散的模型,它将三维场景生成为单元块,并无缝整合新块以扩展场景。BlockFusion 使用从完整三维场景网格中随机裁剪的三维块数据集进行训练。通过逐块拟合,所有训练块被转换为混合神经场:包含几何特征的三平面,随后是一个用于解码有符号距离值的多层感知机。采用变分自编码器将三平面压缩到潜在三平面空间,并在该空间上执行去噪扩散过程。应用于潜在表示的扩散过程能够实现高质量且多样化的三维场景生成。为了在生成过程中扩展场景,只需附加与当前场景重叠的空块,并外推现有的潜在三平面以填充新块。外推是通过在去噪迭代过程中,以来自重叠三平面的特征样本为条件来引导生成过程实现的。潜在三平面外推产生了语义和几何上有意义的过渡,与现有场景和谐融合。使用二维布局条件机制来控制场景元素的放置和排列。实验结果表明,BlockFusion 能够在室内和室外场景中生成多样化、几何一致且无界的大型三维场景,并具有前所未有的高质量形状。

关键词

引用

@article{arxiv.2401.17053,
  title  = {BlockFusion: Expandable 3D Scene Generation using Latent Tri-plane Extrapolation},
  author = {Zhennan Wu and Yang Li and Han Yan and Taizhang Shang and Weixuan Sun and Senbo Wang and Ruikai Cui and Weizhe Liu and Hiroyuki Sato and Hongdong Li and Pan Ji},
  journal= {arXiv preprint arXiv:2401.17053},
  year   = {2024}
}

备注

ACM Transactions on Graphics (SIGGRAPH'24). Code: https://yang-l1.github.io/blockfusion