在线视频理解:OVBench 与 VideoChat-Online
计算机视觉与模式识别
2025-04-18 v2 机器学习
摘要
多模态大语言模型(MLLM)在离线视频理解方面取得了显著进展。然而,由于需要处理连续的在线视频流,在实际场景中应用这些模型(如自动驾驶和人机交互)存在独特挑战。为此,本文从评估基准、模型架构和训练策略三个角度系统性地开展工作:首先,我们引入OVBench—a 个全面的问答基准,旨�评估模型在在线视频情境中感知、记忆和推理能力。该基准涵盖6种核心任务类型,跨越过去、现在和未来三个时间语境,形成16个子任务,来自多样化数据集。其次,我们提出一种新的金字塔记忆库(PMB),有效保留视频流中的关键时空信息。最后,我们提出一种离线到在线的学习范式,设计了面向在线视频数据的交错对话格式,构建了针对在线视频训练的指令调优数据集。该框架促成了VideoChat-Online模型的开发,这是一个稳健且高效的在线视频理解模型。尽管计算成本较低且效率更高,VideoChat-Online在流行的离线视频基准和OVBench上均优于现有最先进的离线和在线模型,分别提升了4.19%和23.7%,显示着我们模型架构和训练策略的有效性。
引用
@article{arxiv.2501.00584,
title = {Online Video Understanding: OVBench and VideoChat-Online},
author = {Zhenpeng Huang and Xinhao Li and Jiaqi Li and Jing Wang and Xiangyu Zeng and Cheng Liang and Tao Wu and Xi Chen and Liang Li and Limin Wang},
journal= {arXiv preprint arXiv:2501.00584},
year = {2025}
}
备注
CVPR 2025 Camera Ready Version. Project Page: https://videochat-online.github.io