中文

GOEmbed:用于表示无关三维特征学习的梯度源嵌入

计算机视觉与模式识别 2024-07-16 v2 图形学

摘要

将来自物体二维视图的信息编码为三维表示对于广义的三维特征提取至关重要。这些特征随后可以实现三维重建、三维生成和其他应用。我们提出了 GOEmbed(Gradient Origin Embeddings,梯度源嵌入),它将输入的二维图像编码为任意三维表示,而无需预训练的图像特征提取器;这与典型的现有方法不同,在那些方法中,输入图像要么使用从大型预训练模型中提取的二维特征进行编码,要么设计定制特征来处理不同的三维表示;更糟的是,对于诸如 MLP 和哈希网格等专门的三维神经表示,可能还没有可用的编码器。我们在 OmniObject3D 基准上的不同实验设置下广泛评估了提出的 GOEmbed。首先,我们通过一个名为 Plenoptic-Encoding 的演示实验,评估了该机制在多种三维表示上与现有编码机制相比的性能。其次,通过将 GOEmbed 与 DFM(Diffusion with Forward Models,前向模型扩散)相结合(我们称之为 GOEmbedFusion),在 OmniObject3D 生成任务上达到了 22.12 的全新 SOTA FID,进一步证明了 GOEmbed 机制的有效性。最后,我们评估了 GOEmbed 机制如何增强稀疏视图三维重建流程。

关键词

引用

@article{arxiv.2312.08744,
  title  = {GOEmbed: Gradient Origin Embeddings for Representation Agnostic 3D Feature Learning},
  author = {Animesh Karnewar and Roman Shapovalov and Tom Monnier and Andrea Vedaldi and Niloy J. Mitra and David Novotny},
  journal= {arXiv preprint arXiv:2312.08744},
  year   = {2024}
}

备注

ECCV 2024 conference; project page at: https://holodiffusion.github.io/goembed/