E$^3$C:基于3D环境记忆与自我-外人体姿态控制的视频生成
计算机视觉与模式识别
2026-05-27 v1 人工智能
摘要
可控且物理驱动的第三人称视频生成对于具身智能体理解其自身及他人动作如何改变世界至关重要。与通用视频合成相比,第三人称生成尤其具有挑战性:相机与演员紧密耦合,导致快速视角变化和频繁自遮挡;潜在动作细微、复杂且常仅部分可见;人物与场景状态必须与指定控制保持一致。我们提出EC(Environment-Ego-Exo),一种用于第三人称生成的可控视频扩散框架,构建结构化且紧凑的条件,将持久场景结构与人类驱动的动态分离。从上下文帧中,EC构建基于半稠密点云的3D记忆,并为每个点添加来自视频-VAE特征的外观描述符。将此记忆渲染到目标视角后,可产生与目标帧对齐的条件。人类动态单独建模:场景中观察到的人物通过骨架渲染(外人体控制)控制,而相机佩戴者通过其3D身体关节和6DoF手腕运动指定(自人体控制)。为在佩戴者身体部位不可见时保持自人体控制,我们引入自我运动编码器,产生持久的交叉注意力标记。Nymeria上的实验表明,EC在视觉保真度、相机运动精度、物体一致性以及自我/外人体控制方面优于强大基线,同时实现直观场景编辑。
引用
@article{arxiv.2605.26316,
title = {E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control},
author = {Qiao Gu and Lingni Ma and Adam W Harley and Richard Newcombe and Florian Shkurti and Julian Straub},
journal= {arXiv preprint arXiv:2605.26316},
year = {2026}
}
备注
Preprint. Project Page: https://e3c-videogen.github.io/