中文

ReCA:基于递归上下文分配的多镜头长视频 extrapolation

计算机视觉与模式识别 2026-05-27 v1 人工智能

摘要

分钟级电影级视频生成是生成式视频模型的核心挑战。现有方法仅解决该挑战的片段:单镜头 extrapolation 保留锚点但缺乏电影结构,而多镜头叙事则赋予结构但可以自由发明其视觉状态而非延续观察到的状态。我们定义了多镜头视频 extrapolation(MSVE),该任务在保持锚点状态的同时,将观察到的帧或片段扩展为一系列具电影结构的镜头,同时推进叙事意图。该设置受限于短视频模型的有限调用预算。我们识别出三个相互关联的瓶颈:(1)全局规划器过度指定来自完整剧本的不受支持细节;(2)镜头级提示在携带完整故事时稀释任务相关状态;(3)时间链式方法将生成帧转化为损耗的记忆,其中身份、场景、对象和行动状态会衰减。MSVE揭示了长视频失败不仅是上下文长度的限制,更是上下文分配的失败。我们提出了递归上下文分配(ReCA),一种在推理时间分配上下文的框架,按层次结构分配规划和生成的上下文。ReCA递归分解MSVE为受限上下文的子问题,在叶节点调用冻结生成器,并在时间上传递结构化状态更新。为评估此设置,我们进一步提出了MSVE-Bench和NB-Q,一个以源为基础的协议,针对3至5分钟的长视频生成 purpose-built 提示,尚未被现有短片段基准测试覆盖。与以前的方法相比,ReCA在最强对手基础上将平均归一化分数提高了8至16个百分点,将多镜头一致性指标提高了28至43个百分点。项目页面请访问 https://reca.vmv.re。

关键词

引用

@article{arxiv.2605.26525,
  title  = {ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation},
  author = {Akide Liu and Jinbo Xing and Chaojie Mao and Ye Li and Zeyu Zhang and Yefei He and Weijie Wang and Zihan Wang and Yu Liu and Gholamreza Haffari and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2605.26525},
  year   = {2026}
}

备注

Project Page: https://reca.vmv.re , Code: https://github.com/ali-vilab/ReCA