中文

VChain:用于视频生成推理的链式视觉思考

计算机视觉与模式识别 2026-05-22 v2

摘要

最近的视频生成模型可以产生平滑且视觉上令人愉悦的片段,但它们往往难以合成具有连贯因果链的复杂动态。准确地在时间上建模视觉结果和状态转换仍是核心挑战。相比之下,大型语言和多模态模型(如 GPT-4o)在视觉状态推理和未来预测方面表现出强大的能力。为弥合这种优势,我们引入 VChain,一种新的推理时链式视觉思考框架,将多模态模型注入视觉生成。具体而言,VChain 包含一个专门的管道,利用大型多模态模型生成一组稀疏的关键帧作为快照,然后用于仅在这些关键时刻对预训练视频生成器进行稀疏推理时的视觉状态适应。我们的方法高效且开销最小,避免密集监督。在复杂的多步骤场景上的大量实验表明,VChain 显著提升了生成视频的质量。

关键词

引用

@article{arxiv.2510.05094,
  title  = {VChain: Chain-of-Visual-Thought for Reasoning in Video Generation},
  author = {Ziqi Huang and Ning Yu and Gordon Chen and Haonan Qiu and Paul Debevec and Ziwei Liu},
  journal= {arXiv preprint arXiv:2510.05094},
  year   = {2026}
}

备注

ACL 2026 (Findings Paper), ICCV 2025 Workshop Outstanding Paper Award, Project page: https://eyeline-labs.github.io/VChain