中文

EgoReAct:自我中心视频驱动的 3D 人体反应生成

计算机视觉与模式识别 2026-01-06 v2 人工智能

摘要

人类对自我中心视觉输入表现出自适应的、上下文敏感的反应。然而,由于对严格因果生成和精确 3D 空间对齐的双重需求,从自我中心视频中忠实地建模此类反应仍然具有挑战性。为了解决这个问题,我们首先构建了人体反应数据集,通过建立空间对齐的自我中心视频-反应数据集来解决数据稀缺和不对齐问题,因为现有数据集(例如 ViMo)在自我中心视频和反应动作之间存在显著的空间不一致性,例如,动态移动的动作总是与固定摄像机的视频配对。利用 HRD,我们提出了 EgoReAct,这是第一个从自我中心视频流实时生成 3D 对齐的人体反应动作的自回归框架。我们首先通过 Vector Quantised-Variational AutoEncoder 将反应动作压缩到一个紧凑而富有表现力的潜空间中,然后训练一个 Generative Pre-trained Transformer 以根据视觉输入生成反应。EgoReAct 在生成过程中引入了 3D 动态特征,即度量深度和头部动力学,这有效地增强了空间定位。大量实验表明,与现有方法相比,EgoReAct 实现了明显更高的真实感、空间一致性和生成效率,同时在生成过程中保持了严格的因果性。我们将在论文被接收后发布代码、模型和数据。

关键词

引用

@article{arxiv.2512.22808,
  title  = {EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation},
  author = {Libo Zhang and Zekun Li and Tianyu Li and Zeyu Cao and Rui Xu and Xiaoxiao Long and Wenjia Wang and Jingbo Wang and Yuan Liu and Wenping Wang and Daquan Zhou and Taku Komura and Zhiyang Dou},
  journal= {arXiv preprint arXiv:2512.22808},
  year   = {2026}
}

备注

12 pages, 9 figures