中文

未来光流预测改进机器人控制与视频生成

计算机视觉与模式识别 2026-01-19 v1

摘要

未来运动表示(如光流)对控制和生成任务具有巨大价值。然而,预测可泛化的空间密集运动表示仍是一项关键挑战,且从有噪声的真实世界数据中学习此类预测的方法在很大程度上尚未被探索。我们引入了 FOCPred,一种新颖的语言条件光流预测模型,其特征在于统一的 Vision-Language Model (VLM) 与 Diffusion 架构。这种独特的组合实现了强大的多模态推理能力与像素级生成保真度,以用于未来运动预测。我们的模型在 Web 级人类活动数据上训练——这是一种高度可扩展但非结构化的来源。为了从这些有噪声的视频-文本数据中提取有意义的信号,我们采用了关键的数据预处理技术以及具有强大图像预训练的统一架构。随后,训练得到的模型被扩展以应对控制和生成中的两项不同下游任务。在语言驱动设定下的机器人操作和视频生成评估确立了 FOCPred 的跨领域通用性,证实了统一的 VLM-Diffusion 架构以及从多样化 Web 数据中进行可扩展学习对未来光流预测的价值。

关键词

引用

@article{arxiv.2601.10781,
  title  = {Future Optical Flow Prediction Improves Robot Control & Video Generation},
  author = {Kanchana Ranasinghe and Honglu Zhou and Yu Fang and Luyu Yang and Le Xue and Ran Xu and Caiming Xiong and Silvio Savarese and Michael S Ryoo and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2601.10781},
  year   = {2026}
}

备注

Project Site (Code, Models, Demo): https://fofpred.github.io