中文

CaC:通过分层时空聚焦推进视频奖励模型

计算机视觉与模式识别 2026-05-29 v2 人工智能

摘要

本文提出 CaC(Concentrate and Concentrate),一种基于视觉-语言模型的由粗到细异常奖励模型。在推理过程中,它首先进行全局时间扫描以锚定异常时间窗口,然后在定位的时间区间内执行细粒度空间定位,最后通过结构化的时空思维链推理得出稳健的判断。为了使模型具备这些能力,我们构建了首个大规模生成视频异常数据集,该数据集包含逐帧边界框标注、时间异常窗口和细粒度属性标签。基于此数据集,我们设计了一个三阶段渐进式训练范式。模型首先通过单帧和多帧监督微调学习空间和时间定位,然后通过基于两轮分组相对策略优化(GRPO)的强化学习策略进行优化。除了传统的准确率奖励外,我们还引入了时间和空间 IoU 奖励来监督中间定位过程,有效引导模型进行更可靠、更可解释的时空推理。大量实验表明,CaC 能够稳定地聚焦于细微异常,在细粒度异常基准测试上实现了 25.7% 的准确率提升,并且当用作奖励信号时,CaC 能将生成视频的异常减少 11.7%,同时提升整体视频质量。

关键词

引用

@article{arxiv.2605.11723,
  title  = {CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating},
  author = {Jiyuan Wang and Huan Ouyang and Jiuzhou Lin and Chunyu Lin and Dewen Fan and Boheng Zhang and Haonan Fan and Fei Zuo and Jia Sun and Huaiqing Wang and Honglie Wang and Yiyang Fan and Zhenlong Yuan and Zijun Li and Yongrui Heng and Guosheng Lin and Fan Yang and Tingting Gao},
  journal= {arXiv preprint arXiv:2605.11723},
  year   = {2026}
}

备注

27 pages, 10 figures