中文

UniUGG:基于几何-语义编码的统一 3D 理解与生成框架

计算机视觉与模式识别 2026-03-10 v3

摘要

尽管近期的统一架构在图像的理解与生成方面取得了显著进展,但 3D 任务的集成仍然具有挑战性且基本未被探索。在本文中,我们引入 UniUGG,首个用于 3D 模态的统一理解与生成框架。我们的统一框架运用大语言模型来理解与解码文本和 3D 表示。其核心,我们提出一种空间解码器,利用潜在扩散模型生成高质量的 3D 表示。这使得能够基于参考图像和任意视角变换生成和想象 3D 场景,同时支持空间视觉问答 (VQA) 任务。此外,我们提出几何-语义学习策略对视觉编码器进行预训练。该设计联合捕获输入的语义线索与几何线索,提升空间理解与生成能力。大量实验结果表明,我们的方法在视觉表征、空间理解和 3D 生成方面均表现优异。

关键词

引用

@article{arxiv.2508.11952,
  title  = {UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding},
  author = {Yueming Xu and Jiahui Zhang and Ze Huang and Yurui Chen and Yanpeng Zhou and Zhenyu Chen and Yu-Jie Yuan and Pengxiang Xia and Guowei Huang and Xinyue Cai and Zhongang Qi and Xingyue Quan and Jianye Hao and Hang Xu and Li Zhang},
  journal= {arXiv preprint arXiv:2508.11952},
  year   = {2026}
}