全息视频生成
计算机视觉与模式识别
2026-01-09 v1
摘要
相机控制的生成视频重渲染方法,如 ReCamMaster,已取得显著进展。然而,尽管在单视图设置中取得成功,这些方法在多视图情境下往往难以保持一致性。由于生成模型固有的随机性,确保幻觉区域的时空一致性仍具有挑战性。为此,我们引入PlenopticDreamer,一个同步生成幻觉以维持时空记忆的框架。核心思想是以自回归方式训练一个多输入单输出视频条件模型,辅以相机引导的视频检索策略,该策略自适应地从先前生成的视频中选择显著视频作为条件输入。此外,我们的训练包含渐进式上下文扩展以提高收敛性,自条件化以增强对因误差累积导致的长程视觉退化的鲁棒性,以及长视频条件机制以支持扩展视频生成。针对Basic和Agibot基准进行大量实验,表明PlenopticDreamer实现了视频重渲染的先进技术,提供了卓越的视图同步、高保真视觉效果、准确的相机控制以及多样化的视图转换(例如从第三人称到第三人称,从头部视角到抓取视角的机器人操作)。项目页面:https://research.nvidia.com/labs/dir/plenopticdreamer/
引用
@article{arxiv.2601.05239,
title = {Plenoptic Video Generation},
author = {Xiao Fu and Shitao Tang and Min Shi and Xian Liu and Jinwei Gu and Ming-Yu Liu and Dahua Lin and Chen-Hsuan Lin},
journal= {arXiv preprint arXiv:2601.05239},
year = {2026}
}
备注
Project Page: https://research.nvidia.com/labs/dir/plenopticdreamer/