EgoTwin:在第一人称视角下构想身体与视角
计算机视觉与模式识别
2025-08-19 v1
摘要
虽然对异侧视频合成取得了很大进展,但以第一人称视角的视频生成仍基本未被探索,这需要同时建模 wearer 身体运动引发的第一人称视角内容以及相机运动模式。为弥合这一差距,我们提出了一种新的任务,即联合 egocentric 视频和人类运动生成,其特点是:1)视点对齐:生成视频中的相机轨迹必须准确地与从人类运动中推导出的头部轨迹对齐;2)因果相互作用:合成的人类运动必须与相邻视频帧所观察到的视觉动态在因果上对齐。为解决这些挑战,我们提出了 EgoTwin,这是一个建立在扩散转换器架构上的联合视频-运动生成框架。具体而言,EgoTwin 引入一种以头部为中心的运动表示,将人类运动锚定在头部关节,并包含一种受神经科学启发的交互机制,显式地在注意力操作中捕获视频与运动之间的因果相互作用。为进行全面评估,我们策划了一个大型真实世界数据集,包含同步的文本-视频-运动三元组,并设计了新的指标来评估视频与运动的一致性。广泛的实验表明,EgoTwin 框架有效且可行。
引用
@article{arxiv.2508.13013,
title = {EgoTwin: Dreaming Body and View in First Person},
author = {Jingqiao Xiu and Fangzhou Hong and Yicong Li and Mengze Li and Wentao Wang and Sirui Han and Liang Pan and Ziwei Liu},
journal= {arXiv preprint arXiv:2508.13013},
year = {2025}
}