ObjectForesight:从人类视频中预测未来 3D 物体轨迹
计算机视觉与模式识别
2026-03-24 v2
摘要
人类能够毫不费力地预判物体如何通过交互移动或改变——例如想象杯子被举起、刀子切片或盖子被合上。我们旨在赋予计算系统类似的能力,使其直接从被动视觉观察中预测合理的未来物体运动。我们引入了 ObjectForesight,这是一种以 3D 物体为中心的动力学模型,能够从短第一人称视频序列中预测刚性物体的未来 6-DoF 位姿与轨迹。与在像素空间或潜在空间中运行的传统世界模型或动力学模型不同,ObjectForesight 在物体层面显式地以 3D 表示世界,从而实现几何上合理且时间上连贯的预测,捕捉物体的可供性与轨迹。为了大规模训练此类模型,我们利用分割、网格重建和 3D 位姿估计方面的最新进展,整理了一个包含 200 多万个带有伪真值 3D 物体轨迹的短视频片段数据集。通过大量实验,我们表明 ObjectForesight 在准确性、几何一致性以及对未见物体和场景的泛化能力上取得了显著提升,建立了一个直接从观察中学习物理合理、以物体为中心的动力学模型的可扩展框架。objectforesight.github.io
引用
@article{arxiv.2601.05237,
title = {ObjectForesight: Predicting Future 3D Object Trajectories from Human Videos},
author = {Rustin Soraki and Homanga Bharadhwaj and Ali Farhadi and Roozbeh Mottaghi},
journal= {arXiv preprint arXiv:2601.05237},
year = {2026}
}
备注
Preprint. Project Website: objectforesight.github.io