中文

FIction:从视频预测 4D 未来交互

计算机视觉与模式识别 2025-04-15 v2

摘要

预测人将如何与环境中的物体进行交互对于活动理解至关重要,但现有方法受限于视频帧的 2D 空间,捕捉物理上不 grounded 的“是什么”预测,忽略了“在哪里”和“如何”。我们提出了 FIction 用于从视频进行 4D 未来交互预测。给定人类活动的输入视频,目标是预测该人将在下一个时间段内与哪些位于何处 3D 位置的物体进行交互(例如,橱柜、冰箱),以及他们将如何执行该交互(例如,屈膝、伸手、拉取的姿势)。我们的 novel 模型 FIction 将过去视频观察的人类动作及其环境融合,以预测未来交互的“在哪里”和“如何”。通过在 EgoExo4D 中的各种活动和真实环境的全面实验,我们表明我们的方法在先前的自回归和(提升的)2D 视频模型方面显著优于,相对于提升超过 30%。

关键词

引用

@article{arxiv.2412.00932,
  title  = {FIction: 4D Future Interaction Prediction from Video},
  author = {Kumar Ashutosh and Georgios Pavlakos and Kristen Grauman},
  journal= {arXiv preprint arXiv:2412.00932},
  year   = {2025}
}

备注

CVPR 2025 (Highlight)