一步一步展望未来
计算机视觉与模式识别
2026-04-13 v1 人工智能
机器学习
摘要
准确预测复杂、多样场景如何演化 requires 表示不确定性、沿扩展 interaction chain 模拟,以及高效探索众多可能的未来。然而,大多数现有方法依赖密集视频或潜在空间预测,在密集外观上消耗了大量容量,而非针对场景中稀疏点轨迹的底层结构。这使得大规模探索未来假设昂贵且在长期、多模态运动至关重要时性能受限。我们通过将 open-set future scene dynamics 的预测 formulation 为稀疏点轨迹的逐步推断来解决这一问题。我们的自回归扩散模型通过短的、局部可预测的转换推进这些轨迹,显式地建模随时间增长的不确定性。这一 dynamics-centric 表示法使我们能够从单个图像快速 rollout 数千条多样化的未来,或可选由初始运动约束引导,同时保持物理上合理性和长程一致性。我们进一步引入 OWM,一个基于多样化 in-the-wild 视频的 open-set motion prediction benchmark,用于评估预测轨迹分布在真实世界不确定性下的准确性和可变性。我们的方法在预测准确性上与密集模拟器相当,同时实现了数量级更高的采样速度,使 open-set future prediction 既可扩展又实用。项目页面: http://compvis.github.io/myriad
引用
@article{arxiv.2604.09527,
title = {Envisioning the Future, One Step at a Time},
author = {Stefan Andreas Baumann and Jannik Wiese and Tommaso Martorella and Mahdi M. Kalayeh and Björn Ommer},
journal= {arXiv preprint arXiv:2604.09527},
year = {2026}
}
备注
CVPR 2026. For code and models, see http://compvis.github.io/myriad