中文

NViST:基于 Transformer 的真实场景单图像新视图合成

计算机视觉与模式识别 2024-04-02 v2

摘要

我们提出了 NViST,一种基于 Transformer 的模型,能够从单张图像高效且可泛化地合成真实场景的新视图。许多方法在合成数据、以物体为中心的场景或特定类别上进行训练,与此不同,NViST 在 MVImgNet 上进行训练;MVImgNet 是一个大规模数据集,包含数百个物体类别且背景多样的随手拍摄真实世界视频。NViST 将图像输入直接转换为辐射场,并通过自适应层归一化以相机参数为条件。在实践中,NViST 利用微调的掩码自编码器(MAE)特征,并通过交叉注意力将其转换为 3D 输出 token,同时利用自注意力处理遮挡问题。为了摆脱以物体为中心的数据集并实现完整场景合成,NViST 采用 6-DOF 相机位姿模型,仅需相对位姿,免除了对训练数据进行规范化的需求,从而消除了将其应用于随手拍摄数据集的重大障碍。我们展示了在 MVImgNet 中未见过的物体和类别上的结果,甚至展示了对手机随手拍摄的泛化能力。我们在 MVImgNet 和 ShapeNet 上进行了定性和定量评估,表明我们的模型在实现真正的真实场景单图像可泛化新视图合成方面迈出了一步。项目网页:https://wbjang.github.io/nvist_webpage。

关键词

引用

@article{arxiv.2312.08568,
  title  = {NViST: In the Wild New View Synthesis from a Single Image with Transformers},
  author = {Wonbong Jang and Lourdes Agapito},
  journal= {arXiv preprint arXiv:2312.08568},
  year   = {2024}
}

备注

CVPR 2024, Project page: https://wbjang.github.io/nvist_webpage