Video-as-Answer:基于 Joint-GRPO 的视频事件预测与生成
摘要
尽管语言模型在众多实际应用中发挥着重要作用,视频生成仍主要局限于娱乐领域。我们意识到视频固有的能力——展示难以通过语言传达的物理世界信息(例如,仅用文本教 someone 系领带)——未被充分利用,将视频作为一种新的 answer modality 用于 Next-Event Prediction(NEP),formalized 为 Video-Next-Event Prediction(VNEP)。虽然已建立的 NEP 任务以视频和程序化或预测性问题为输入,以文本形式预测下一个事件,但 VNEP 需要动态的视频 response。从 telling 转向 showing 这一变化 unlock 了更直观、更具定制性的答案,适用于程序学习和创意探索。然而,针对现有模型的 VNEP 挑战重大,因为它需要理解多模态输入、instruction-conditioned 推理以及生成在视觉和语义上一致的视频。为此,我们提出了 VANS(Video-Answer Next-Scene),一个利用强化学习将 Vision-Language Model(VLM)与 Video Diffusion Model(VDM)对齐以实现 VNEP 的模型。VANS 的核心是我们提出的 Joint-GRPO,它将 VLM 和 VDM 作为一个单元运行。由其各自输出的 shared reward驱动,优化 VLM 以产生既 accurate 又 friendly to visualize 的 caption,同时指导 VDM 生成这些 caption 和输入视觉上下文一致的视频。为实现此学习,我们构建了 VANS-Data-100K,一个专为 VNEP 任务设计的数据集。在程序化和预测性基准测试上的实验表明,VANS 在视频事件预测和可视化方面实现了 state-of-the-art 性能。代码已发布于 https://github.com/KlingTeam/VANS。
引用
@article{arxiv.2511.16669,
title = {Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO},
author = {Junhao Cheng and Liang Hou and Xin Tao and Jing Liao},
journal= {arXiv preprint arXiv:2511.16669},
year = {2025}
}
备注
Project page: https://video-as-answer.github.io/