UMAMI:将掩码自回归模型与确定性渲染统一用于视角合成
计算机视觉与模式识别
2025-12-24 v1
摘要
新视角合成(NVS)旨在仅通过稀疏的已定位视图,即可从未见的相机位姿渲染出照片级逼真且三维一致的图像。现有确定性网络可快速渲染观察区域,但会模糊处理未观察区域;而基于随机扩散的方法则会幻觉生成合理内容,却造成较高的训练和推理成本。本文提出一种混合框架,统一两大范式的优势。双向变换器对多视图图像标记和普朗克射线嵌入进行编码,生成共享的潜在表示。随后,两个轻量级头部分别发挥作用:(i)一个前馈回归头部用于渲染几何约束良好的像素;(ii)一个掩码自回归扩散头部用于完成遮挡或未见区域。整个模型以联合光度损失和扩散损失进行端到端训练,无需手工设计的3D归纳偏置,因而可跨越 diverse 场景实现可扩展性。实验表明,我们的方法在图像质量上达到最新水平,同时将渲染时间显著降低(约一个数量级),优于完全生成式基线方法。
引用
@article{arxiv.2512.20107,
title = {UMAMI: Unifying Masked Autoregressive Models and Deterministic Rendering for View Synthesis},
author = {Thanh-Tung Le and Tuan Pham and Tung Nguyen and Deying Kong and Xiaohui Xie and Stephan Mandt},
journal= {arXiv preprint arXiv:2512.20107},
year = {2025}
}
备注
Accepted to NeurIPS 2025. The first two authors contributed equally