中文

全身条件下的 egocentric 视频预测

计算机视觉与模式识别 2025-06-27 v1 人工智能 机器学习 多媒体 机器人学

摘要

我们训练模型以给定过去视频和以相对 3D 身体姿态表示的动作来预测 Ego-centric Video(PEVA)。通过以关节层次结构结构化的运动学姿态轨迹为条件,我们的模型学习了从第一人称视角模拟物理人类动作如何塑造环境。我们在 Nymeria 大规模真实世界 egocentric 视频和身体姿态捕获数据上训练了一个 auto-regressive conditional diffusion transformer。我们进一步设计了分层评估协议,以制定越来越具挑战性的任务,全面分析模型的具身预测和控制能力。我们的工作代表了初步尝试以人类视角进行视频预测,以挑战建模复杂真实环境和具身智能体行为的难题。

关键词

引用

@article{arxiv.2506.21552,
  title  = {Whole-Body Conditioned Egocentric Video Prediction},
  author = {Yutong Bai and Danny Tran and Amir Bar and Yann LeCun and Trevor Darrell and Jitendra Malik},
  journal= {arXiv preprint arXiv:2506.21552},
  year   = {2025}
}

备注

Project Page: https://dannytran123.github.io/PEVA