EgoExo-Gen:通过观看从众视角视频进行以第一人称视角为导向的视频预测
计算机视觉与模式识别
2025-04-17 v1
摘要
以第一人称视角生成视频在增强现实和具身智能领域具有广阔的应用前景。在本工作中,我们探索跨视图视频预测任务:给定从众视角视频、对应以第一人称视角视频的第一帧以及文本指令,目标是生成该以第一人称视角视频的后续帧。我们瞄目手-物体互动(HOI)在以第一人称视角视频中代表当前演员的主要意图和动作,因而提出EgoExo-Gen,通过显式建模手-物体动态实现跨视图视频预测。EgoExo-Gen由两个阶段构成:首先,我们设计一种跨视图 HOI 掩码预测模型,通过建模时空 ego-exo 对应关系,预测未来 ego 帧的 HOI 掩码;随后,我们采用视频扩散模型,以第一帧 ego 帧和文本指令为输入,融入 HOI 掩码作为结构引导,提高预测质量。为便于训练,我们开发了一个自动化管道,利用视觉基础模型生成 ego 视频和 exo 视频的伪 HOI 掩码。大量实验表明,我们提出的EgoExo-Gen在Ego-Exo4D和H2O基准数据集上优于先前视频预测模型,HOI掩码显著提升了 ego 视图视频中手部和交互物体的生成质量。
引用
@article{arxiv.2504.11732,
title = {EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos},
author = {Jilan Xu and Yifei Huang and Baoqi Pei and Junlin Hou and Qingqiu Li and Guo Chen and Yuejie Zhang and Rui Feng and Weidi Xie},
journal= {arXiv preprint arXiv:2504.11732},
year = {2025}
}
备注
ICLR 2025