中文

面向3D点云生成的具有极端掩码的扩散Transformer快速训练

计算机视觉与模式识别 2023-12-13 v1 人工智能 机器学习

摘要

Diffusion Transformers近期在生成高质量3D点云方面展现出显著的有效性。然而,由于注意力算子的立方复杂度(源于体素的额外维度),训练用于高分辨率3D体素的基于体素的扩散模型仍然代价极高。受3D相较于2D具有内在冗余性的启发,我们提出了FastDiT-3D,一种专为高效3D点云生成量身定制的掩码扩散Transformer,可大幅降低训练成本。具体而言,我们从掩码自编码器中汲取灵感,在掩码化的体素化点云上动态执行去噪过程。我们还提出了一种新颖的体素感知掩码策略,以自适应地聚合来自体素化点云的背景/前景信息。我们的方法在近99%的极端掩码率下实现了SOTA性能。此外,为了改进多类别3D生成,我们在3D扩散模型中引入了Mixture-of-Expert (MoE)。每个类别可以通过不同的专家学习独特的扩散路径,从而缓解梯度冲突。在ShapeNet数据集上的实验结果表明,我们的方法实现了SOTA的高保真和多样化3D点云生成性能。我们的FastDiT-3D在生成128分辨率的体素点云时,仅使用原始训练成本的6.5%,便提升了1-Nearest Neighbor Accuracy和Coverage指标。

关键词

引用

@article{arxiv.2312.07231,
  title  = {Fast Training of Diffusion Transformer with Extreme Masking for 3D Point Clouds Generation},
  author = {Shentong Mo and Enze Xie and Yue Wu and Junsong Chen and Matthias Nießner and Zhenguo Li},
  journal= {arXiv preprint arXiv:2312.07231},
  year   = {2023}
}

备注

Project Page: https://dit-3d.github.io/FastDiT-3D/