RIVER:面向视频 LLM 的实时交互基准
计算机视觉与模式识别
2026-03-05 v1
摘要
多模态大语言模型的快速发展展现出惊人的能力, 但几乎所有模型都处于离线范式, 限制了实时交互.为填补这一空白, 我们引入 Real-tIme Video intERaction Bench(RIVER Bench), 用于评估在线视频理解. RIVER Bench 引入一种新框架, 包括 Retrospective Memory(回溯记忆)、Live-Perception(实时感知)和 Proactive Anticipation(主动预判)任务, 紧密模拟交互式对话而非一次性响应整个视频.我们使用来自多样化来源且时长各异的视频进行详细标注, 并精确定义实时交互格式.对 various model 类别的评估显示, 虽然离线模型在单问题问答任务中表现良好, 但在实时处理方面面临挑战.针对现有模型在在线视频交互中的局限性, 尤其是长期记忆和未来感知的缺失, 我们提出了一种通用改进方法, 使模型能够在实时内与用户进行更灵活的交互.我们相信本工作将显著推动实时交互式视频理解模型的发展, 并激发该新兴领域的后续研究.数据集和代码已公开于 https://github.com/OpenGVLab/RIVER.
引用
@article{arxiv.2603.03985,
title = {RIVER: A Real-Time Interaction Benchmark for Video LLMs},
author = {Yansong Shi and Qingsong Zhao and Tianxiang Jiang and Xiangyu Zeng and Yi Wang and Limin Wang},
journal= {arXiv preprint arXiv:2603.03985},
year = {2026}
}