CompGS:通过动态优化 3D Gaussians 释放 2D 组合性以实现组合式文本到 3D 生成
计算机视觉与模式识别
2024-10-29 v1
摘要
文本引导图像生成的近期突破显著推进了 3D 生成领域。虽然现在生成单个高质量 3D 物体已成为可能,但在 3D 空间中生成具有合理交互的多个物体(即组合式 3D 生成)仍面临巨大挑战。本文引入了 CompGS,一种采用 3D Gaussian Splatting(GS)进行高效、组合式文本到 3D 内容生成的新型生成框架。为实现这一目标,提出了两个核心设计:(1)具有 2D 组合性的 3D Gaussians 初始化:我们将成熟的 2D 组合性迁移至逐实体初始化 Gaussian 参数,确保每个实体具有一致的 3D 先验且多个实体间具有合理的交互;(2)动态优化:我们提出了一种利用 Score Distillation Sampling(SDS)损失来优化 3D Gaussians 的动态策略。CompGS 首先自动将 3D Gaussians 分解为不同的实体部分,从而在实体层面和组合层面进行优化。此外,CompGS 通过动态调整每个实体的空间参数,跨不同尺度的物体进行优化,增强了细粒度细节的生成,尤其是在较小实体中。在 T3Bench 上的定性比较和定量评估表明,CompGS 在生成具有优于现有方法的图像质量和语义对齐的组合式 3D 物体方面具有有效性。CompGS 还可轻松扩展至可控 3D 编辑,促进场景生成。我们希望 CompGS 能为组合式 3D 生成提供新的见解。项目页面:https://chongjiange.github.io/compgs.html。
引用
@article{arxiv.2410.20723,
title = {CompGS: Unleashing 2D Compositionality for Compositional Text-to-3D via Dynamically Optimizing 3D Gaussians},
author = {Chongjian Ge and Chenfeng Xu and Yuanfeng Ji and Chensheng Peng and Masayoshi Tomizuka and Ping Luo and Mingyu Ding and Varun Jampani and Wei Zhan},
journal= {arXiv preprint arXiv:2410.20723},
year = {2024}
}