中文

利用 Token 解耦与合成数据扩展基于 Transformer 的新视角合成模型

图形学 2025-09-09 v1 计算机视觉与模式识别

摘要

大型基于 Transformer 的模型在从稀疏输入视角进行可泛化新视角合成(NVS)方面取得了显著进展,无需测试时优化即可生成新视角。然而,这些模型受限于公开可用场景数据集的有限多样性,导致大多数真实世界场景成为分布外数据。为克服这一问题,我们引入了由扩散模型生成的合成训练数据,这改善了在未见域上的泛化能力。尽管合成数据提供了可扩展性,但我们发现数据生成过程中引入的伪影是影响重建质量的关键瓶颈。为解决此问题,我们在 Transformer 架构内提出了一种 Token 解耦过程,增强了特征分离并确保了更有效的学习。这一改进不仅提升了相对于标准 Transformer 的重建质量,还使得使用合成数据的可扩展训练成为可能。因此,我们的方法在数据集内和跨数据集评估上均优于现有模型,在多个基准上取得了最先进的结果,同时显著降低了计算成本。项目页面:https://scaling3dnvs.github.io/

关键词

引用

@article{arxiv.2509.06950,
  title  = {Scaling Transformer-Based Novel View Synthesis Models with Token Disentanglement and Synthetic Data},
  author = {Nithin Gopalakrishnan Nair and Srinivas Kaza and Xuan Luo and Vishal M. Patel and Stephen Lombardi and Jungyeon Park},
  journal= {arXiv preprint arXiv:2509.06950},
  year   = {2025}
}

备注

Accepted at ICCV 2025