GenLit:将单图像重照明重新表述为视频生成
计算机视觉与模式识别
2025-10-24 v4 图形学
摘要
在单张图像中操控 3D 场景的光照是计算机视觉与图形学中的一个基本挑战。该问题传统上使用逆向渲染技术解决,这涉及显式的 3D 资产重建和昂贵的光线追踪模拟。与此同时,视觉基础模型的最新进展表明,一种新的范式可能很快成为可能——即用在大量图像和视频数据上训练的网络来替代显式物理模型。在本文中,我们利用视频扩散模型(特别是 Stable Video Diffusion)对场景的隐式理解能力,对单张图像进行重照明。我们引入了 GenLit,这是一个将图形引擎执行光照操控的能力蒸馏到视频生成模型中的框架,使用户能够在给定图像中直接在 3D 世界中插入并操控点光源,并直接以视频序列形式生成结果。我们发现,仅在小型合成数据集上微调的模型即可泛化至真实场景,实现具有合理且令人信服的阴影与相互反射的单图像重照明。我们的结果突显了视频基础模型捕捉光照、材质和形状丰富信息的能力,并且我们的发现表明,此类模型仅需极少的训练即可用于执行重照明,而无需显式的资产重建或光线追踪。项目页面:https://genlit.is.tue.mpg.de/。
引用
@article{arxiv.2412.11224,
title = {GenLit: Reformulating Single-Image Relighting as Video Generation},
author = {Shrisha Bharadwaj and Haiwen Feng and Giorgio Becherini and Victoria Fernandez Abrevaya and Michael J. Black},
journal= {arXiv preprint arXiv:2412.11224},
year = {2025}
}