中文

ROVER:基于视觉语言模型对视频进行递归推理以实现具身任务

计算与语言 2025-12-01 v2 人工智能 计算机视觉与模式识别 机器人学

摘要

视觉语言模型(VLM)在 diverse 图像理解任务中展现出惊人的能力, 但在需要推理来自视频连续帧序列的情境时仍显得吃力。这限制了其在具身环境中的实用性,后者需要在每个时刻的持续视觉输入序列中进行长期帧序列的推理。为此, 我们提出了ROVER(Reasoning Over VidEo Recursively),一个框架,使模型能够递归地将长期视频轨迹分解为对应轨迹中较短子任务的若干段。如此, ROVER在不损失全局上下文的前提下, 促进了对局部化帧序列的更聚焦且准确的推理。我们使用基于原语学习的方法实现了ROVER, 并在多样化的OpenX Embodiment视频数据集以及一个新构建的RoboCasa数据集上进行评估。后者包含543个视频,展示了专家和扰动的非专家轨迹,覆盖27个机器人操作任务。ROVER在三个视频推理任务上超越了强大的基线: 任务进度估计、帧级自然语言推理和视频问答。我们观察到, 通过减少模型在每个时刻需要推理的帧数, ROVER在轨迹的意外或非最优时刻尤其有效地缓解了幻觉现象。此外, 通过实现子任务特定的滑动上下文窗口, ROVER的时间复杂性随视频长度呈线性比例, 这是基线方法的渐进性改进。演示、代码和数据可在https://rover-vlm.github.io获取。

关键词

引用

@article{arxiv.2508.01943,
  title  = {ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks},
  author = {Philip Schroeder and Ondrej Biza and Thomas Weng and Hongyin Luo and James Glass},
  journal= {arXiv preprint arXiv:2508.01943},
  year   = {2025}
}