中文

增强 NeRF 如同增强 LLM:基于混合视图专家的可泛化 NeRF Transformer

计算机视觉与模式识别 2023-08-24 v1

摘要

能够直接合成未见场景新视图的跨场景可泛化 NeRF 模型,已成为 NeRF 领域的新焦点。若干现有尝试依赖于日益端到端“神经化”的架构,即用诸如 transformer 等高性能神经网络替换场景表示和/或渲染模块,并将新视图合成转变为前馈推理流程。尽管那些前馈“神经化”架构在开箱状态下仍不能很好地拟合多样场景,我们提出借助来自大语言模型(LLM)的强大混合专家(MoE)思想来弥合这一差距,该思想已通过平衡更大的整体模型容量与灵活的逐实例专门化展示了优越的泛化能力。从近期一种称为 GNT 的可泛化 NeRF 架构出发,我们首先证明 MoE 可以被简洁地插入以增强该模型。我们进一步定制了一个共享永久专家和一个几何感知一致性损失,分别用于强制跨场景一致性和空间平滑性,而这对可泛化视图合成至关重要。我们提出的模型称为带有混合视图专家的 GNT(GNT-MOVE),实验表明其在迁移到未见场景时取得了最先进的结果,表明在零样本和少样本设置下均具有显著更好的跨场景泛化能力。我们的代码可在 https://github.com/VITA-Group/GNT-MOVE 获取。

关键词

引用

@article{arxiv.2308.11793,
  title  = {Enhancing NeRF akin to Enhancing LLMs: Generalizable NeRF Transformer with Mixture-of-View-Experts},
  author = {Wenyan Cong and Hanxue Liang and Peihao Wang and Zhiwen Fan and Tianlong Chen and Mukund Varma and Yi Wang and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2308.11793},
  year   = {2023}
}

备注

Accepted by ICCV2023