使用大型语言模型进行程序化视频预测
计算机视觉与模式识别
2025-05-22 v1 人工智能
机器学习
摘要
估计描述真实世界过程动力学的世界模型的任务具有极其重要的意义,这对于预测和准备未来结果至关重要。对于视频监视、机器人应用、自动驾驶等应用而言,这一目标涉及给定视频的前几帧,以建立视觉上下文,合成合理的视觉未来。为此,我们提出了ProgGen,通过代表每个视频帧的由神经符号(human-interpretable)的一组状态(一个帧一个状态),来完成视频帧预测任务,同时利用大型(视觉)语言模型(LLM/VLM)的归纳偏置。具体而言,ProgGen利用LLM/VLM合成程序:(i)给定视觉上下文(即帧)来估计视频的状态;(ii)通过估计转换动力学来预测对应于未来时间步的状态;(iii)将预测的状态渲染为视觉RGB帧。经验评估显示,我们的方法在两个具有挑战性的环境中优于竞争技术进行视频帧预测:(i)PhyWorld;(ii)Cart Pole。此外,ProgGen允许逆向推理和可解释的视频生成,证明了其有效性和通用性,用于视频生成任务。
引用
@article{arxiv.2505.14948,
title = {Programmatic Video Prediction Using Large Language Models},
author = {Hao Tang and Kevin Ellis and Suhas Lohit and Michael J. Jones and Moitreya Chatterjee},
journal= {arXiv preprint arXiv:2505.14948},
year = {2025}
}