InverseCrafter:基于潜在域逆问题的高效视频重捕获
计算机视觉与模式识别
2025-12-08 v1 人工智能
机器学习
摘要
最近的可控 4D 视频生成方法往往依赖在预训练视频扩散模型(VDMs)上进行微调。这一主导范式计算昂贵,需要大规模数据集和架构修改,常常会严重遗忘模型原始生成先验。本文提出 InverseCrafter,一个高效的填充逆求解器,将 4D 生成任务重新表述为在潜在空间中解决填充问题。我们的方法核心是将像素空间退化算子编码为连续的、多通道潜在掩码,从而绕过了昂贵的 VAE 操作和反向传播的瓶颈。InverseCrafter 不仅在几乎零计算开销下实现了相当于新视角生成并在相机控制任务中优于现有方法的测量一致性,还在通用视频填充方面表现突出。代码已公开:https://github.com/yeobinhong/InverseCrafter。
引用
@article{arxiv.2512.05672,
title = {InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem},
author = {Yeobin Hong and Suhyeon Lee and Hyungjin Chung and Jong Chul Ye},
journal= {arXiv preprint arXiv:2512.05672},
year = {2025}
}