从粗到真实:生成式渲染用于人口密集的动态场景
计算机视觉与模式识别
2026-05-13 v3
摘要
传统渲染管道依赖复杂资产、准确材质和照明,以及大量计算资源才能生成逼真的图像,但仍面临规模和逼真度在人口密集动态场景中的挑战。我们提出C2R(粗到真实),一种生成式渲染框架,用于从粗糙3D模拟合成真实风格的城市群众视频。我们的方法利用粗糙3D渲染显式控制场景布局、摄像机运动和人类轨迹,同时通过文本提示引导学习的神经渲染器生成逼真的外观、照明和细粒度动态。为克服粗糙模拟与真实视频之间缺乏配对训练数据的限制,我们采用两阶段合成-真实域跳跃策略:首先从大规模真实影片中学习强大的生成先验,然后通过少量配对的粗糙-精细数据引入可控性,以在域之间共享隐式时空特征。最终系统支持粗到精细的控制,跨越多样化的CG和游戏输入,产生在时间上一致、可控且逼真的城市场景视频。我们将在https://gonzalognogales.github.io/coarse2real/发布模型和项目网页。
引用
@article{arxiv.2601.22301,
title = {Coarse-to-Real: Generative Rendering for Populated Dynamic Scenes},
author = {Gonzalo Gomez-Nogales and Yicong Hong and Chongjian Ge and Peiye Zhuang and Marc Comino-Trinidad and Dan Casas and Yi Zhou},
journal= {arXiv preprint arXiv:2601.22301},
year = {2026}
}
备注
Project website at https://gonzalognogales.github.io/coarse2real/