EgoControl:基于3D全身姿态的可控三维 egocentric 视频生成
计算机视觉与模式识别
2025-11-25 v1
摘要
通过身体动作实现细粒度可控的三维自我中心视频生成是向具身智能体(能够模拟、预测和规划动作的智能体)靠近的关键要求。本文提出EgoControl,一个基于三维自我中心数据训练的姿态可控视频扩散模型。我们训练一个视频预测模型,将未来帧的生成条件化为显式的3D身体姿态序列。为实现精确的运动控制,我们引入一种新颖的姿态表示方法,既捕捉全局相机动力学,又捕捉具象化身体运动,并通过扩散过程中的专用控制机制将其集成。给定一段观察到的短序列帧和一序列目标姿态,EgoControl生成与提供的姿态控制相匹配的、在时间上连贯且视觉上真实的未来帧。实验结果表明,EgoControl能够产生高质量、姿态一致的三维自我中心视频,为可控的具身视频仿真和理解铺平了道路。
引用
@article{arxiv.2511.18173,
title = {EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses},
author = {Enrico Pallotta and Sina Mokhtarzadeh Azar and Lars Doorenbos and Serdar Ozsoy and Umar Iqbal and Juergen Gall},
journal= {arXiv preprint arXiv:2511.18173},
year = {2025}
}