StreamingBench: 评估多模态大语言模型实现流式视频理解的差距
计算机视觉与模式识别
2024-11-07 v1 人工智能
摘要
多模态大语言模型(MLLMs)的快速发展将其能力从图像理解扩展到了视频理解。然而,这些MLLMs大多主要关注离线视频理解,需要在任何查询之前对所有视频帧进行大量处理。这与人类实时观看、聆听、思考和响应流式输入的能力相比存在显著差距,凸显了当前MLLMs的局限性。在本文中,我们介绍了StreamingBench,这是第一个旨在评估MLLMs流式视频理解能力的综合基准。StreamingBench评估流式视频理解的三个核心方面:(1)实时视觉理解,(2)全源理解,以及(3)上下文理解。该基准包含18个任务,涉及900个视频和4,500个人工策划的问答对。每个视频在不同时间点提出五个问题,以模拟连续的流式场景。我们在StreamingBench上对13个开源和专有MLLMs进行了实验,发现即使是最先进的专有MLLMs,如Gemini 1.5 Pro和GPT-4o,其表现也显著低于人类水平的流式视频理解能力。我们希望我们的工作能够促进MLLMs的进一步发展,使其能够在更真实的场景中接近人类水平的视频理解和交互。
引用
@article{arxiv.2411.03628,
title = {StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding},
author = {Junming Lin and Zheng Fang and Chi Chen and Zihao Wan and Fuwen Luo and Peng Li and Yang Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2411.03628},
year = {2024}
}