中文

Exo2EgoSyn:解锁基础视频生成模型用于外视角到自我视角视频合成

计算机视觉与模式识别 2025-11-26 v1

摘要

WAN 2.2等基础视频生成模型在文本和图像条件化合成方面表现出色,但仍受限于相同视角的生成设定。在本工作中,我们提出了Exo2EgoSyn,即WAN 2.2的一种适配,用于解锁外视角到自我视角(Exo2Ego)跨视角视频合成。我们的框架包含三个关键模块。自我-外视角视图对齐(EgoExo-Align)强制外视角与自我视角首帧表示之间的潜在空间对齐,将生成空间从给定的外视角重新定向到自我视角。多视角外视角视频条件化(MultiExoCon)将多视角外视角视频聚合为统一的条件信号,将WAN2.2扩展至其原始的单图像或文本条件化之外。此外,姿态感知潜在注入(PoseInj)将相对的外视角到自我视角相机姿态信息注入潜在状态,引导跨视角的几何感知合成。这些模块共同使得无需从头重新训练即可从第三人称观测生成高保真度的自我视角视频。在ExoEgo4D上的实验验证了Exo2EgoSyn显著提升了自我视角到外视角合成,为以基础模型为核心的可扩展跨视角视频生成铺平了道路。源代码和模型将公开发布。

关键词

引用

@article{arxiv.2511.20186,
  title  = {Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis},
  author = {Mohammad Mahdi and Yuqian Fu and Nedko Savov and Jiancheng Pan and Danda Pani Paudel and Luc Van Gool},
  journal= {arXiv preprint arXiv:2511.20186},
  year   = {2025}
}