SPIKE-RL:视频-LLM 遇见贝叶斯惊讶
计算机视觉与模式识别
2025-09-30 v1 计算与语言
摘要
现实世界的视频常显示出被令人难忘、惊讶事件点缀的常规活动。然而,大多数 Video-LLM 通过均匀抽样帧来处理视频,可能错过定义视频叙事的关键时刻。我们提出 SPIKE,一种在视频流中量化贝叶斯惊讶的推理框架,即由新视觉证据触发的信念更新,用于识别与先前信念相冲突的新视觉证据出现的时刻。SPIKE 有效地局部化惊讶,在积极(FunQA)和消极(Oops!)惊讶基准测试中与人类高度相关。由于零-shot Video-LLM 的信念往往次优,我们开发 SPIKE-RL,该框架利用 GRPO 优化信念假设,基于视频标题中的奖励信号。SPIKE 和 SPIKE-RL 指导查询无关的惊讶加权帧抽样,在视频中有趣时刻分配更多帧。通过此策略,我们在五个下游基准测试中相对于均匀抽样实现持续的性能提升。通过使 Video-LLM 能够跟踪信念并注册惊讶,我们的工作为构建能够对新信息作出修正的更稳健模型铺平了道路。
引用
@article{arxiv.2509.23433,
title = {SPIKE-RL: Video-LLMs meet Bayesian Surprise},
author = {Sahithya Ravi and Aditya Chinchure and Raymond T. Ng and Leonid Sigal and Vered Shwartz},
journal= {arXiv preprint arXiv:2509.23433},
year = {2025}
}
备注
10 pages, 4 figures, Code: https://github.com/sahithyaravi/SPIKE-RL