中文

StreamEQA:面向具身场景的流式视频理解

计算机视觉与模式识别 2025-12-05 v1

摘要

随着具身智能向现实部署发展,持续感知和推理流式视觉输入的能力变得至关重要。在此类场景中,智能体必须保持对周围环境的态势感知,理解与周围实体的交互,并根据过去的观察、当前的上下文和预期的未来事件动态规划行动。为了推动这一方向的研究,我们提出了StreamEQA,这是首个面向具身场景中流式视频问答的基准。StreamEQA沿两个正交维度评估现有的多模态大语言模型(MLLMs):具身和流式。在具身维度上,问题被分为三个层次:感知、交互和规划,依次评估模型识别细粒度视觉细节、推理智能体-物体交互以及进行高层目标导向推理的能力。对于流式维度,问题被分为回溯推理、实时推理和前向推理,每种模式依赖不同的时间上下文。基于156个独立长视频,StreamEQA定义了42个任务,并通过结合自动生成与人工优化的混合流水线生成了约21K个带有精确时间戳的问答对。对13种最先进的视频大语言模型的评估显示,尽管这些模型在传统基准上表现强劲,但它们在具身场景中的流式视频理解方面仍然存在困难。我们希望StreamEQA能够推动具身应用中流式视频理解的研究。

关键词

引用

@article{arxiv.2512.04451,
  title  = {StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios},
  author = {Yifei Wang and Zhenkai Li and Tianwen Qian and Huanran Zheng and Zheng Wang and Yuqian Fu and Xiaoling Wang},
  journal= {arXiv preprint arXiv:2512.04451},
  year   = {2025}
}