中文

释放 Vecset Diffusion Model 以实现快速形状生成

计算机视觉与模式识别 2025-03-27 v2 人工智能 图像与视频处理

摘要

通过所谓的“原生”3D扩散,特别是 Vecset Diffusion Model (VDM) 的发展,3D形状生成已极大繁荣。尽管近期进展在生成高分辨率3D形状方面展现出可喜的成果,但 VDM 在高速生成方面仍面临挑战。挑战的存在不仅因为加速扩散采样存在困难,还因为 VDM 中的 VAE 解码存在困难,这些领域在先前的工作中探索不足。为了应对这些挑战,我们提出了 FlashVDM,一个用于加速 VDM 中 VAE 和 DiT 的系统框架。对于 DiT,FlashVDM 实现了灵活的扩散采样,仅需少至5步推理即可获得可比的质量,这得益于我们新引入的 Progressive Flow Distillation 稳定了 consistency distillation。对于 VAE,我们引入了一个配备 Adaptive KV Selection、Hierarchical Volume Decoding 和 Efficient Network Design 的闪电式 vecset 解码器。通过利用 vecset 的局部性和形状表面在体积中的稀疏性,我们的解码器大幅降低了 FLOPs,最小化了整体解码开销。我们将 FlashVDM 应用于 Hunyuan3D-2 以获得 Hunyuan3D-2 Turbo。通过系统评估,我们表明我们的模型显著优于现有的快速3D生成方法,实现了与 state-of-the-art 可比的性能,同时将重建的推理时间减少了45倍以上,将生成减少了32倍。代码和模型可在 https://github.com/Tencent/FlashVDM 获取。

关键词

引用

@article{arxiv.2503.16302,
  title  = {Unleashing Vecset Diffusion Model for Fast Shape Generation},
  author = {Zeqiang Lai and Yunfei Zhao and Zibo Zhao and Haolin Liu and Fuyun Wang and Huiwen Shi and Xianghui Yang and Qingxiang Lin and Jingwei Huang and Yuhong Liu and Jie Jiang and Chunchao Guo and Xiangyu Yue},
  journal= {arXiv preprint arXiv:2503.16302},
  year   = {2025}
}

备注

Technical report