中文

WildRayZer:动态环境中的自监督大视角合成

计算机视觉与模式识别 2026-01-16 v1

摘要

我们提出了 WildRayZer,一个用于在相机和物体均移动的动态环境中进行新视角合成(NVS)的自监督框架。动态内容破坏了静态 NVS 模型所依赖的多视角一致性,导致重影、幻觉几何和不稳定的姿态估计。WildRayZer 通过执行“由分析到合成”测试来解决这一问题:一个仅含相机的静态渲染器解释刚性结构,其残差揭示瞬态区域。从这些残差中,我们构建伪运动掩码,提炼出一个运动估计器,并使用它来掩蔽输入 token 和门控损失梯度,从而使监督集中于跨视角背景补全。为了实现大规模训练和评估,我们整理了 Dynamic RealEstate10K(D-RE10K),一个包含 15K 随意采集的动态序列的真实世界数据集,以及 D-RE10K-iPhone,一个用于稀疏视角瞬态感知 NVS 的配对瞬态与干净基准。实验表明,WildRayZer 在瞬态区域去除和全帧 NVS 质量上,均以单次前向传播持续优于基于优化的和前馈的基线方法。

关键词

引用

@article{arxiv.2601.10716,
  title  = {WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments},
  author = {Xuweiyi Chen and Wentao Zhou and Zezhou Cheng},
  journal= {arXiv preprint arXiv:2601.10716},
  year   = {2026}
}

备注

Project Page: https://wild-rayzer.cs.virginia.edu/