从同步到序列:通过插值实现外观到内观视频生成
计算机视觉与模式识别
2026-04-16 v1
摘要
外观到内观视频生成旨在从同步的第三人称视角和相应的相机姿态合成第一人称视频。尽管存在配对监督,但同步的外观-内观数据本质上引入了大量的时空和几何 discontinuities,违反了标准视频生成基准的光滑运动假设。我们认识到这种同步引起的跳跃是核心挑战,提出Syn2Seq-Forcing,通过在源视频和目标视频之间进行插值形成单个连续信号。将外观-内观重新表述为序列信号建模而非常规条件-输出任务,使我们能够利用扩散模型(如扩散强制变换器)更有效地捕获跨帧的连贯转换。实验表明,仅对视频进行插值而不进行姿态插值即可显著改善,强调时空 discontinuities是主要难点。除了即时性能提益外,这一表述建立了统一外观-内观和内观-外观生成于单个连续序列模型的通用灵活框架,为跨视图视频合成的未来研究提供了原则性基础。
引用
@article{arxiv.2604.13793,
title = {From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation},
author = {Mohammad Mahdi and Nedko Savov and Danda Pani Paudel and Luc Van Gool},
journal= {arXiv preprint arXiv:2604.13793},
year = {2026}
}