中文

扩展视角合成变换器

计算机视觉与模式识别 2026-02-26 v1 人工智能

摘要

几何无关的视角合成变换器最近在新视角合成(NVS)中取得了最先进的性能,超越了依赖显式几何建模的传统方法。然而,决定其计算规模因素仍不明确。我们系统性地研究了视角合成变换器的规模定律,推导了训练计算最优 NVS 模型的设计原则。与先前发现结果相反,我们表明,编码器-解码器结构亦可计算最优;我们将早先的负面结果归因于亚最优的架构选择以及跨不等训练计算预算的比较。 在多个计算水平上,我们展示,称为可扩展视角合成模型(SVSM)的编码器-解码器架构,规模化效果相当于解码器专用模型,实现了优越的性能-计算帕総前沿,并在大幅度减少训练计算后超越了先前的NVS基准测试中的最先进水平。

关键词

引用

@article{arxiv.2602.21341,
  title  = {Scaling View Synthesis Transformers},
  author = {Evan Kim and Hyunwoo Ryu and Thomas W. Mitchel and Vincent Sitzmann},
  journal= {arXiv preprint arXiv:2602.21341},
  year   = {2026}
}

备注

Project page: https://www.evn.kim/research/svsm