VideoPCDNet:基于相位相关网络的视频解析与预测
计算机视觉与模式识别
2025-06-25 v1 人工智能
摘要
理解和预测视频内容对于在动态环境中进行规划与推理至关重要。尽管已有进展,但对对象表示和动态的无监督学习仍然具有挑战性。我们提出了 VideoPCDNet,一个用于对象中心视频分解和预测的无监督框架。该模型使用频域相位相关技术递归地将视频解析为对象组件,这些组件表示为所学习对象原型的变换版本,从而实现准确且可解释的跟踪。通过显式建模对象运动(结合频域操作和轻量级学习模块),VideoPCDNet 实现了准确的无监督对象跟踪以及对未来视频帧的预测。在实验中,我们展示了 VideoPCDNet 在多个合成数据集上对无监督跟踪和预测任务 outperform 了多种对象中心基线模型,同时学习了可解释的对象和运动表示。
关键词
引用
@article{arxiv.2506.19621,
title = {VideoPCDNet: Video Parsing and Prediction with Phase Correlation Networks},
author = {Noel José Rodrigues Vicente and Enrique Lehner and Angel Villar-Corrales and Jan Nogga and Sven Behnke},
journal= {arXiv preprint arXiv:2506.19621},
year = {2025}
}
备注
Accepted for Publication at ICANN 2025