中文

UniEgoMotion:用于以太动作重建、预测与生成的统一模型

计算机视觉与模式识别 2025-10-17 v2

摘要

以场景为上下文的以太人类动作生成与预测,对于增强AR/VR体验、改善人机交互、发展辅助技术以及实现自适应医疗解决方案具有重要意义,这些都需要准确预测和从第一人称视角模拟运动。然而,现有方法主要聚焦于第三人称动作合成,仅使用结构化3D场景上下文,限制了其在现实以太场景中的有效性——由于视野有限、频繁遮挡以及动态摄像机,场景感知受到限制。为弥合这一差距,本文提出以太动作生成与以太动作预测两个新任务,利用第一人称图像进行场景感知动作合成,而无需依赖显式3D场景。我们提出UniEgoMotion,一个针对以太设备的新颖头部中心动作表示的统一条件动作扩散模型。UniEgoMotion简洁而有效的设计支持从第一人称视觉输入进行以太动作重建、预测与生成。与忽视场景语义的前述工作不同,本模型有效提取图像基的场景上下文,以推断合理的3D动作。为便于训练,我们引入EE4D-Motion数据集,源自EgoExo4D,并增添伪地面真实3D动作标注。UniEgoMotion在以太动作重建方面实现了最先进的性能,并首次实现单一以太图像的动作生成。广泛的评估表明,我们的统一框架有效果,为以太动作建模树立了新的基准,为以太应用开输了新的可能性。

关键词

引用

@article{arxiv.2508.01126,
  title  = {UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation},
  author = {Chaitanya Patel and Hiroki Nakamura and Yuta Kyuragi and Kazuki Kozuka and Juan Carlos Niebles and Ehsan Adeli},
  journal= {arXiv preprint arXiv:2508.01126},
  year   = {2025}
}

备注

ICCV 2025. Project Page: https://chaitanya100100.github.io/UniEgoMotion/