中文

通过像素级梯度裁剪增强高分辨率三维生成

计算机视觉与模式识别 2024-01-19 v4

摘要

高分辨率三维物体生成仍是一项具有挑战性的任务,主要由于全面标注训练数据的有限可用性。近期进展旨在利用在大量精选网络数据集上预训练的图像生成模型,通过诸如分数蒸馏采样(SDS)等知识迁移技术克服此限制。高效满足高分辨率渲染需求常需采用基于潜表示模型,如潜扩散模型(LDM)。在此框架中,出现一重大挑战:为计算单个图像像素的梯度,须将梯度从指定潜空间经图像模型的冻结组件(如 LDM 内所用的 VAE 编码器)反向传播。然而,该梯度传播路径从未被优化,在训练中保持不受控。我们发现无约束梯度 adversely 影响三维模型从图像生成模型获取纹理相关信息的能力,导致外观合成质量差。为解决此总体挑战,我们提出一种称为像素级梯度裁剪(PGC)的创新操作,旨在无缝集成至现有三维生成模型,从而提升其合成质量。具体而言,我们通过高效裁剪像素级梯度来控制随机梯度的大小,同时保留关键的纹理相关梯度方向。尽管简单且额外开销极小,大量实验证明了我们的 PGC 在增强现有三维生成模型高分辨率物体渲染性能方面的有效性。

关键词

引用

@article{arxiv.2310.12474,
  title  = {Enhancing High-Resolution 3D Generation through Pixel-wise Gradient Clipping},
  author = {Zijie Pan and Jiachen Lu and Xiatian Zhu and Li Zhang},
  journal= {arXiv preprint arXiv:2310.12474},
  year   = {2024}
}

备注

Accepted at ICLR 2024. Project page: https://fudan-zvg.github.io/PGC-3D