MAR-3D:用于高分辨率三维生成的渐进式掩码自回归器
计算机视觉与模式识别
2025-04-22 v3
摘要
自回归 Transformer 的最新进展已革新了从语言处理到视觉生成等多个领域的生成式建模,展现出卓越的能力。然而,将这些进展应用于三维生成面临三大关键挑战:三维数据的无序性与序列化的下一词元预测范式相冲突;传统的向量量化方法应用于三维网格时会产生显著的压缩损失;以及缺乏针对更高分辨率潜变量预测的高效扩展策略。为应对这些挑战,我们提出了 MAR-3D,它将金字塔变分自编码器与级联掩码自回归 Transformer(Cascaded MAR)相结合,在连续空间中实现渐进式潜变量上采样。我们的架构在训练时采用随机掩码,在推理时以随机顺序进行自回归去噪,天然契合三维潜变量词元的无序特性。此外,我们提出了一种结合条件增强的级联训练策略,能够以快速收敛高效地提升潜变量词元分辨率。大量实验表明,MAR-3D 不仅在性能与泛化能力上优于现有方法,而且相较于联合分布建模方法(如扩散 Transformer)展现出更强的可扩展性。
引用
@article{arxiv.2503.20519,
title = {MAR-3D: Progressive Masked Auto-regressor for High-Resolution 3D Generation},
author = {Jinnan Chen and Lingting Zhu and Zeyu Hu and Shengju Qian and Yugang Chen and Xin Wang and Gim Hee Lee},
journal= {arXiv preprint arXiv:2503.20519},
year = {2025}
}
备注
CVPR 2025 Highlight: https://jinnan-chen.github.io/projects/MAR-3D/