IllumiCraft:用于可控视频生成的统一几何与光照扩散模型
计算机视觉与模式识别
2025-06-04 v1 人工智能
机器学习
多媒体
摘要
尽管基于扩散的模型能够根据文本或图像输入生成高质量、高分辨率的视频序列,但在控制跨帧的场景光照和视觉外观时,它们缺乏对几何线索的显式整合。为了解决这一局限性,我们提出了 IllumiCraft,这是一个端到端的扩散框架,接受三种互补输入:(1) 用于详细光照控制的高动态范围 (HDR) 视频图;(2) 具有随机光照变化的合成重照明帧(可选配静态背景参考图像)以提供外观线索;(3) 捕获精确 3D 几何信息的 3D 点轨迹。通过在统一的扩散架构中整合光照、外观和几何线索,IllumiCraft 生成了与用户定义提示对齐的时间连贯视频。它支持背景条件和文本条件的视频重照明,并且比现有的可控视频生成方法具有更好的保真度。项目页面:https://yuanze-lin.me/IllumiCraft_page
引用
@article{arxiv.2506.03150,
title = {IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation},
author = {Yuanze Lin and Yi-Wen Chen and Yi-Hsuan Tsai and Ronald Clark and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2506.03150},
year = {2025}
}
备注
Tech Report