StreamingEval:面向真实流式视频理解的统一评估协议
计算机视觉与模式识别
2026-03-24 v1 多媒体
摘要
实时、连续的视觉信号理解是实现现实交互式人工智能应用的关键需求,构成了基础系统级挑战。然而,现有研究在流式视频理解领域,通常仅聚焦于受限视觉上下文下的问答准确率或编码效率提升,却大体忽视了在真实资源约束下的实际部署可行性。为弥合这一鸿沟,我们提出StreamingEval——一个用于评估Video-LLM在真实约束下的流式视频理解能力的统一评估框架。StreamingEval 在标准化评估协议下,对主流离线模型和最新在线视频模型进行基准测试,明确刻画了效率、存储与准确率之间的权衡。具体而言,我们采用固定容量的记忆库来规范可访问的历史视觉上下文,联合评估视觉编码效率、文本解码延迟和任务性能,以量化整体系统的部署可行性。跨多个数据集的大量实验揭示了当前Video-LLM与真实流式应用需求之间的显著差距,为该方向的后续研究提供了系统化的依据。代码将在 https://github.com/wwgTang-111/StreamingEval1 发布。
引用
@article{arxiv.2603.21493,
title = {StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding},
author = {Guowei Tang and Tianwen Qian and Huanran Zheng and Yifei Wang and Xiaoling Wang},
journal= {arXiv preprint arXiv:2603.21493},
year = {2026}
}