TFDM:基于 Mamba 的时变频率点云扩散模型
计算机视觉与模式识别
2025-03-18 v1
摘要
扩散模型目前在各种生成任务中展现出令人印象深刻的性能。近期关于图像扩散的工作突显了 Mamba(状态空间模型)在处理长程依赖和序列数据建模方面的强大能力。遗憾的是,将状态空间模型与 3D 点云生成结合考虑的研究仍然有限。为了利用 Mamba 模型在 3D 点云生成方面的强大能力,我们提出了一种新颖的扩散框架,包含双潜在 Mamba 块(DM-Block)和时变频率编码器(TF-Encoder)。DM-Block 应用空间填充曲线将点重排为适合 Mamba 状态空间建模的序列,同时在潜在空间中操作,以减轻直接 3D 数据处理带来的计算开销。同时,TF-Encoder 利用扩散模型在后期恢复阶段细化精细细节的能力,通过在 U-Net 架构中优先处理关键点。这种基于频率的机制确保了在生成的最后阶段具有增强的细节质量。在 ShapeNet-v2 数据集上的实验结果表明,我们的方法在特定类别的某些指标上达到了最先进的性能(ShapeNet-v2:1-NNA-Abs50 EMD 上为 0.14%,COV EMD 上为 57.90%),同时将计算参数和推理时间分别减少了高达 10 倍和 9 倍。源代码可在补充材料中获取,并将在论文被接受后发布。
引用
@article{arxiv.2503.13004,
title = {TFDM: Time-Variant Frequency-Based Point Cloud Diffusion with Mamba},
author = {Jiaxu Liu and Li Li and Hubert P. H. Shum and Toby P. Breckon},
journal= {arXiv preprint arXiv:2503.13004},
year = {2025}
}