中文

用于 3D 扩散模型的 64 维潜在向量表示

计算机视觉与模式识别 2025-07-29 v2 人工智能

摘要

通过变分自编码器(VAE)构建压缩潜在空间是高效 3D 扩散模型的关键。本文介绍了 COD-VAE,该方法将 3D 形状编码为紧凑的 1D 潜在向量集合,同时不牺牲质量。COD-VAE 提出了两阶段自编码器方案以提高压缩率和解码效率。首先,编码器模块通过中间点块逐步将点云压缩为紧凑的潜在向量。其次,基于三平面(triplane)的解码器从潜在向量重建稠密三平面,而非直接解码神经场,从而显著降低神经场解码的计算开销。最后,我们提出不确定性引导的 token 剪枝,按需分配资源,通过跳过较简单区域的计算来提高解码器效率。实验结果表明,COD-VAE 相较于基线实现了 16 倍的压缩率,同时保持质量。这使生成速度提升 20.8 倍,说明大量潜在向量并非是高质量重建和生成的必需条件。代码已公开于 https://github.com/join16/COD-VAE。

关键词

引用

@article{arxiv.2503.08737,
  title  = {Representing 3D Shapes With 64 Latent Vectors for 3D Diffusion Models},
  author = {In Cho and Youngbeom Yoo and Subin Jeon and Seon Joo Kim},
  journal= {arXiv preprint arXiv:2503.08737},
  year   = {2025}
}