LiveStar:面向实时在线视频理解的直播助理
计算机视觉与模式识别
2025-11-10 v1 人工智能
摘要
尽管视频大型语言模型(Video-LLM)在离线视频理解方面取得了显著进展,但现有的在线 Video-LLM 通常难以同时处理连续帧输入和确定最佳响应时机,往往牺牲实时性和叙事连贯性。为此,我们引入 LiveStar,一款实现始终在线主动响应的直播助理,通过自适应流式解码实现。具体而言,LiveStar 包括:(1)一种使变量长度视频流实现增量视频-语言对齐的训练策略,保留动态演化帧序列之间的时间一致性;(2)一种响应-沉默解码框架,通过单次前向传递验证确定最佳主动响应时机;(3)基于峰值-结束记忆压缩的记忆感知加速,用于在线推理 10+ 分钟的视频,结合流式键值缓存实现 1.53 倍的加速。我们还构建了 OmniStar 数据集,这是一个涵盖 15 种多样化真实场景和 5 项评估任务的综合性数据集,用于在线视频理解的训练和基准测试。广泛的实验在三个基准上表明,LiveStar 实现了最先进的性能,在语义正确性上平均提升 19.5%,在时差上减少 18.1%,同时在所有五个 OmniStar 任务中提升 12.0% 的帧率。我们的模型和数据集可在 https://github.com/yzy-bupt/LiveStar 上获取。
关键词
引用
@article{arxiv.2511.05299,
title = {LiveStar: Live Streaming Assistant for Real-World Online Video Understanding},
author = {Zhenyu Yang and Kairui Zhang and Yuhang Hu and Bing Wang and Shengsheng Qian and Bin Wen and Fan Yang and Tingting Gao and Weiming Dong and Changsheng Xu},
journal= {arXiv preprint arXiv:2511.05299},
year = {2025}
}
备注
NeurIPS 2025 Accepted