中文

Vista:基于场景感知的流式视频问答优化方案用于后置查询

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

流式视频问答(Streaming Video QA)为多模态大语言模型(MLLM)带来了独特挑战,因为视频帧按顺序到达,用户可以在任意时刻提出查询。现有解决方案依赖固定大小的记忆或粗糙压缩,往往在长时间、实时场景中导致上下文丢失或内存溢出,限制了其效果。我们提出了Vista,这是一个面向场景感知的流式视频问答框架,使其能在连续视频流上进行高效且可扩展的推理。Vista的创新点可以概括为三个方面:(1)场景感知分段,在此基础上,Vista动态地将输入帧聚类为在时间和视觉上连贯的场景单元;(2)场景感知压缩,将每个场景压缩为紧凑的标记表示并存储在GPU内存中以实现高效的基于索引的检索,同时将原始分辨率帧卸载到CPU内存;(3)场景感知召回,在收到查询后,选择性地召回相关场景并重新集成到模型输入中,从而实现效率和完整性的平衡。Vista是模型无关的,并能无缝集成到各种视觉语言底层模型中,使其在不牺牲延迟或内存效率的情况下实现长上下文推理。广泛的实验在StreamingBench上表明,Vista实现了最先进的性能,为实际的流式视频理解奠定了强大的基准。

关键词

引用

@article{arxiv.2602.08448,
  title  = {Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries},
  author = {Haocheng Lu and Nan Zhang and Wei Tao and Xiaoyang Qu and Guokuan Li and Jiguang Wan and Jianzong Wang},
  journal= {arXiv preprint arXiv:2602.08448},
  year   = {2026}
}

备注

Accepted to AAAI 2026 (Main Technical Track)