Lumen:基于视频生成模型的一致视频 relighting 与和谐背景替换
计算机视觉与模式识别
2025-08-19 v1
摘要
视频 relighting是一项具有挑战性且宝贵的任务,旨在替换视频中的背景,同时相应调整前景的灯光以实现和谐融合。在翻译过程中,必须保留前景的原始属性(如albedo),并在时间帧之间传播一致的 relighting。本文提出Lumen,一个基于大规模视频生成模型开发的端到端视频 relighting框架,支持灵活的文本描述以指导灯光和背景的控制。鉴于缺乏高质量的配对视频(即相同前景在不同灯光条件下),我们构建了一个大规模数据集,包含真实与合成视频的混合内容。对于合成域,利用社区中丰富的3D资产,借助先进的3D渲染引擎策划在多样环境下的视频配对。对于真实域,通过HDR-based灯光模拟弥补缺乏野外配对视频的不足。凭借上述数据集,我们设计联合训练课程,有效发挥各域优势,即合成视频的物理一致性和真实视频的泛化域分布。为实现此目标,我们将域感知适配器注入模型,以解耦 relighting学习与域外观分布的学习。我们构建了全面的基准测试,用于评估Lumen及现有方法,从前景保留和视频一致性两个维度进行评估。实验结果表明,Lumen能够有效地将输入编辑为具有一致灯光和严格前景保留的电影化 relighted视频。我们的项目页面:https://lumen-relight.github.io/
引用
@article{arxiv.2508.12945,
title = {Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models},
author = {Jianshu Zeng and Yuxuan Liu and Yutong Feng and Chenxuan Miao and Zixiang Gao and Jiwang Qu and Jianzhang Zhang and Bin Wang and Kun Yuan},
journal= {arXiv preprint arXiv:2508.12945},
year = {2025}
}
备注
15 pages, 7 figures