FIction:从视频预测 4D 未来交互
计算机视觉与模式识别
2025-04-15 v2
摘要
预测人将如何与环境中的物体进行交互对于活动理解至关重要,但现有方法受限于视频帧的 2D 空间,捕捉物理上不 grounded 的“是什么”预测,忽略了“在哪里”和“如何”。我们提出了 FIction 用于从视频进行 4D 未来交互预测。给定人类活动的输入视频,目标是预测该人将在下一个时间段内与哪些位于何处 3D 位置的物体进行交互(例如,橱柜、冰箱),以及他们将如何执行该交互(例如,屈膝、伸手、拉取的姿势)。我们的 novel 模型 FIction 将过去视频观察的人类动作及其环境融合,以预测未来交互的“在哪里”和“如何”。通过在 EgoExo4D 中的各种活动和真实环境的全面实验,我们表明我们的方法在先前的自回归和(提升的)2D 视频模型方面显著优于,相对于提升超过 30%。
引用
@article{arxiv.2412.00932,
title = {FIction: 4D Future Interaction Prediction from Video},
author = {Kumar Ashutosh and Georgios Pavlakos and Kristen Grauman},
journal= {arXiv preprint arXiv:2412.00932},
year = {2025}
}
备注
CVPR 2025 (Highlight)