Yesnt:扩散 relighting 模型在捕获阶段合成是否准备好?一种平衡学习先验与物理约束的混合替代方案
计算机视觉与模式识别
2026-01-23 v2 图形学
摘要
体积视频 relighting 是将捕获的表演引入虚拟世界的必不可少的任务,但当前方法在提供稳定、面向生产的结果方面存在挑战。扩散基的单帧内部分解方法在单帧上表现前景光明,但在序列上扩展时受随机噪声和不稳定性制约,而视频扩散模型则受限于记忆和规模。我们提出一种混合 relighting 框架,将扩散推导出的材质先验与时序正则化和物理驱动渲染相结合。该方法将多个随机材质属性估计聚合为具有时序一致性的光照组件,采用基于光流的正则化。对于间接效应(如阴影和反射),我们从高斯 Opacity Fields 中提取网格代理,并在标准图形管道中进行渲染。在真实和合成捕获数据的实验中,本混合策略在序列稳定性上显著优于仅基于扩散的方法,同时也超越了视频扩散模型在剪辑长度上的限制。这些结果表明,平衡学习先验与物理约束的混合方法是实现面向生产的体积视频 relighting 的实际步骤。
关键词
引用
@article{arxiv.2510.23494,
title = {Yesnt: Are Diffusion Relighting Models Ready for Capture Stage Compositing? A Hybrid Alternative to Bridge the Gap},
author = {Elisabeth Jüttner and Janelle Pfeifer and Leona Krath and Stefan Korfhage and Hannah Dröge and Matthias B. Hullin and Markus Plack},
journal= {arXiv preprint arXiv:2510.23494},
year = {2026}
}