中文

生成世界渲染器

计算机视觉与模式识别 2026-04-03 v1

摘要

扩展生成逆向和正向渲染以适应现实场景受限于现有合成数据集的真实性和时间一致性。为弥合这一持续的领域差距,我们引入了一个来自视觉复杂AAA游戏的大型动态数据集。通过一种新颖的双屏幕拼接捕获方法,我们提取了400万连续帧(720p/30 FPS)的同步RGB图和五个G缓冲区通道,覆盖多样化的场景、视觉特效和环境,包括恶劣天气和运动模糊变体。这一数据集独特地推动了双向渲染:实现鲁棒的野外几何和材料分解,促进G缓冲区引导的高保真视频生成。此外,为评估无真实值情境下的逆向渲染性能,我们提出了一种新颖的基于视觉语言模型(VLM)的评估方案,衡量语义、空间和时间一致性。实验表明,针对我们数据微调的逆向渲染器在跨数据集泛化和可控生成方面表现优异,而我们的VLM评估与人类判断高度相关。结合我们的工具套件,我们的正向渲染器可让用户通过文本提示编辑AAA游戏的风格。

关键词

引用

@article{arxiv.2604.02329,
  title  = {Generative World Renderer},
  author = {Zheng-Hui Huang and Zhixiang Wang and Jiaming Tan and Ruihan Yu and Yidan Zhang and Bo Zheng and Yu-Lun Liu and Yung-Yu Chuang and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2604.02329},
  year   = {2026}
}

备注

Project page: https://alaya-studio.github.io/renderer/