中文

GenLayNeRF:基于 3D 模型对齐的可泛化分层表示用于多人体视角合成

计算机视觉与模式识别 2023-09-22 v1

摘要

多人体场景的新视角合成(NVS)因复杂的人间遮挡而颇具挑战。分层表示通过将场景划分为多层辐射场来处理这些复杂性,但它们主要局限于逐场景优化,效率低下。可泛化的人体视角合成方法将预拟合的 3D 人体网格与图像特征结合以实现泛化,但它们主要设计用于单人体场景。另一缺陷是依赖多步优化技术对参数化 3D 身体模型进行预拟合,在稀疏视角设置下其与图像错位,导致合成视角中出现伪影。本工作中,我们提出 GenLayNeRF,一种用于多人体自由视角渲染的可泛化分层场景表示,无需逐场景优化且以极稀疏视角作为输入。我们将场景划分为由 3D 身体网格锚定的多人体层。随后我们通过一个新颖的端到端可训练模块确保身体模型与输入视角的像素级对齐,该模块执行迭代参数化校正并结合多视角特征融合以产生对齐的 3D 模型。对于 NVS,我们提取点级图像对齐且人体锚定的特征,并利用自注意力与交叉注意力模块进行关联与融合。我们通过基于注意力的 RGB 融合模块将低层 RGB 值增强进特征中。为评估我们的方法,我们构建了两个多人体视角合成数据集:DeepMultiSyn 与 ZJU-MultiHuman。结果表明,我们提出的方法优于可泛化及非人体的逐场景 NeRF 方法,同时在与逐场景分层方法性能相当的情况下无需测试时优化。

关键词

引用

@article{arxiv.2309.11627,
  title  = {GenLayNeRF: Generalizable Layered Representations with 3D Model Alignment for Multi-Human View Synthesis},
  author = {Youssef Abdelkareem and Shady Shehata and Fakhri Karray},
  journal= {arXiv preprint arXiv:2309.11627},
  year   = {2023}
}

备注

Accepted to GCPR 2023