中文

ViPro-2:基于集成动力学的无监督状态估计用于指导视频预测

计算机视觉与模式识别 2025-08-11 v1

摘要

预测未来视频帧是一个充满挑战的任务,涉及众多下游应用。先前的工作表明,程序化知识使深度模型在复杂动力学环境中表现良好,但其模型ViPro假设给定的初始符号状态。我们发现,这种方法导致模型学习捷径,实际上并不将观察到的环境与预测的符号状态相连接,导致无法估计给定观察的状态(当以前的状态噪声时)。在本文中,我们对ViPro进行了若干改进,使模型能够在不提供完整初始符号状态的情况下正确推断状态。我们表明,这可以在无监督方式下实现,并将原始Orbits数据集扩展为3D变体,以弥合与真实世界情景之间的差距。

关键词

引用

@article{arxiv.2508.06335,
  title  = {ViPro-2: Unsupervised State Estimation via Integrated Dynamics for Guiding Video Prediction},
  author = {Patrick Takenaka and Johannes Maucher and Marco F. Huber},
  journal= {arXiv preprint arXiv:2508.06335},
  year   = {2025}
}

备注

Published in 2025 International Joint Conference on Neural Networks (IJCNN)