从光线到投影:前馈视图合成的更优输入
计算机视觉与模式识别
2026-01-09 v1
摘要
前馈视图合成模型以单次前向传递、最少的 3D 归纳偏置预测新视图。现有工作将相机编码为 Plücker 光线图,这将预测与任意世界坐标系规范联系起来,使其对微小的相机变换敏感,从而破坏了几何一致性。在本文中,我们探讨何种输入能最好地调节模型以实现稳健且一致的视图合成。我们提出投影条件化,用目标视图投影线索替换原始相机参数,提供稳定的 2D 输入。这将任务从光线空间中脆弱的几何回归问题重新构建为条件良好的目标视图图像到图像翻译问题。此外,我们引入了针对该线索量身定制的掩码自编码预训练策略,从而能够使用大规模未校准数据进行预训练。与基于光线条件的基线相比,我们的方法在我们的视图一致性基准上显示出更高的保真度和更强的跨视图一致性。它还在标准新视图合成基准上实现了 SOTA 质量。
关键词
引用
@article{arxiv.2601.05116,
title = {From Rays to Projections: Better Inputs for Feed-Forward View Synthesis},
author = {Zirui Wu and Zeren Jiang and Martin R. Oswald and Jie Song},
journal= {arXiv preprint arXiv:2601.05116},
year = {2026}
}
备注
Project Page: https://wuzirui.github.io/pvsm-web