LVSM:具有最小3D归纳偏置的大规模视图合成模型
计算机视觉与模式识别
2025-04-04 v2 图形学
机器学习
摘要
我们提出了大规模视图合成模型(LVSM),这是一种新颖的基于Transformer的方法,用于从稀疏视图输入进行可扩展和可泛化的新视图合成。我们引入了两种架构:(1) 编码器-解码器LVSM,它将输入图像令牌编码为固定数量的1D潜在令牌,作为完全学习的场景表示,并从中解码出新视图图像;(2) 仅解码器LVSM,它直接将输入图像映射到新视图输出,完全消除了中间场景表示。两种模型都绕过了先前方法中使用的3D归纳偏置——从3D表示(例如NeRF、3DGS)到网络设计(例如对极投影、平面扫描)——以完全数据驱动的方式处理新视图合成。虽然编码器-解码器模型由于其独立的潜在表示而提供更快的推理速度,但仅解码器LVSM实现了更优的质量、可扩展性和零样本泛化能力,在PSNR上比先前最先进的方法高出1.5至3.5 dB。跨多个数据集的全面评估表明,两种LVSM变体都实现了最先进的新视图合成质量。值得注意的是,即使使用更少的计算资源(1-2个GPU),我们的模型也超越了所有先前的方法。更多详情请参见我们的网站:https://haian-jin.github.io/projects/LVSM/。
引用
@article{arxiv.2410.17242,
title = {LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias},
author = {Haian Jin and Hanwen Jiang and Hao Tan and Kai Zhang and Sai Bi and Tianyuan Zhang and Fujun Luan and Noah Snavely and Zexiang Xu},
journal= {arXiv preprint arXiv:2410.17242},
year = {2025}
}
备注
project page: https://haian-jin.github.io/projects/LVSM/