全身条件下的 egocentric 视频预测
计算机视觉与模式识别
2025-06-27 v1 人工智能
机器学习
多媒体
机器人学
摘要
我们训练模型以给定过去视频和以相对 3D 身体姿态表示的动作来预测 Ego-centric Video(PEVA)。通过以关节层次结构结构化的运动学姿态轨迹为条件,我们的模型学习了从第一人称视角模拟物理人类动作如何塑造环境。我们在 Nymeria 大规模真实世界 egocentric 视频和身体姿态捕获数据上训练了一个 auto-regressive conditional diffusion transformer。我们进一步设计了分层评估协议,以制定越来越具挑战性的任务,全面分析模型的具身预测和控制能力。我们的工作代表了初步尝试以人类视角进行视频预测,以挑战建模复杂真实环境和具身智能体行为的难题。
引用
@article{arxiv.2506.21552,
title = {Whole-Body Conditioned Egocentric Video Prediction},
author = {Yutong Bai and Danny Tran and Amir Bar and Yann LeCun and Trevor Darrell and Jitendra Malik},
journal= {arXiv preprint arXiv:2506.21552},
year = {2025}
}
备注
Project Page: https://dannytran123.github.io/PEVA