基于渲染器代理推理的灯光关联视频生成
计算机视觉与模式识别
2026-04-10 v1
摘要
扩散模型在视频生成方面取得了显著进展,但其可控性仍是主要限制。关键场景因素如布局、灯光和摄像机轨迹往往被缠结或仅弱建模,限制了其在电影制作和虚拟制作等需要显式场景控制的领域的应用。我们提出LiVER,一个基于扩散的框架,用于场景可控视频生成。为实现这一目标,我们引入一种新型框架,将视频合成条件化于显式3D场景属性,并支持一个大规模数据集,其中包含对象布局、灯光和摄像机参数的稠密标注。我们通过从统一3D表示渲染控制信号来分离这些属性。我们提出了一个轻量级条件模块和渐进式训练策略,将这些信号整合到基础视频扩散模型中,确保稳定收敛和高保真度。我们的框架支持广泛的应用,包括图像到视频和视频到视频的合成,其中底层3D场景完全可编辑。为进一步提升可用性,我们开发了一个场景代理,自动将高级用户指令翻译为所需的3D控制信号。实验表明,LiVER在实现最先进的照片 realism 和时序一致性方面取得优异成绩,同时实现了对场景因素的精确、解耦控制,为可控视频生成树立了新标准。
引用
@article{arxiv.2604.07966,
title = {Lighting-grounded Video Generation with Renderer-based Agent Reasoning},
author = {Ziqi Cai and Taoyu Yang and Zheng Chang and Si Li and Han Jiang and Shuchen Weng and Boxin Shi},
journal= {arXiv preprint arXiv:2604.07966},
year = {2026}
}
备注
Accepted to CVPR 2026