LiViBench:用于交互式直播视频理解的全模态基准
计算机视觉与模式识别
2026-01-22 v1
摘要
多模态大语言模型 (MLLM) 的发展推动了通用视频理解能力。然而,现有的视频评估基准主要关注非交互式视频,如电影和录制视频。为填补这一空白,本文提出首个针对交互式直播视频的全模态基准 LiViBench。它包含多样化的 24 项任务,突出感知、推理和直播特有的挑战。为高效构建数据集,我们设计了标准化的半自动标注工作流程,在多个阶段融入人类在环;该工作流程利用多个 MLLM 形成多智能体系统进行综合视频描述,并采用种子问题驱动方法构建高质量标注。基准中的所有交互式视频包含音频、语音和实时评论等模态。为增强模型对交互式视频的理解,我们设计了量身定制的两阶段指令微调方法,并提出了视频到评论检索 (Video-to-Comment Retrieval, VCR) 模块,以提高模型利用实时评论的能力。基于这些突破,我们开发了 LiVi-LLM-7B,一个增强了直播知识的 MLLM。在 LiViBench 上实验表明,我们的模型在多个方面均优于参数更大的开源模型,缩小了与领先专有模型的差距,并在包括 VideoMME、LongVideoBench、MLVU 和 VideoEval-Pro 在内的通用视频基准上实现提升。
引用
@article{arxiv.2601.15016,
title = {LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding},
author = {Xiaodong Wang and Langling Huang and Zhirong Wu and Xu Zhao and Teng Xu and Xuhong Xia and Peixi Peng},
journal= {arXiv preprint arXiv:2601.15016},
year = {2026}
}
备注
AAAI 2026 Main Track