螺旋:基于反思规划智能体的自演化动作条件视频生成
计算机视觉与模式识别
2026-05-22 v3
摘要
长期动作条件视频生成旨在合成沿延长时间范围内遵循复杂动作指令的、在时间上连贯的视频,需满足程序化排序、持续的动作执行以及常规文本到视频生成方法无法实现的场景一致性。现有单次生成的视频模型通常以开环方式运行,导致动作执行不完整、运动幻觉以及时间漂移。为此,我们提出了螺旋(SPIRAL)框架,该框架通过反思规划实现闭环的、基于动作的长期视频生成。具体而言,螺旋实例化了一个思考-执行-反思过程:规划智能体(PlanAgent)将高层目标分解为子动作,以条件化视频生成器(VideoGenerator)合成每个片段并伴随记忆上下文;批评智能体(CriticAgent)评估中间视频片段,为迭代细化提供纠正反馈。该闭环设计进一步支持自演化,通过利用PlanAgent提议的动作和CriticAgent得出的奖励,进行基于GRPO的后训练,以提升视频生成器的长期一致性。此外,我们引入ActVideoGen数据集进行任务特定训练,建立ActVideoGen评估套件,用于衡量动作质量和时间一致性。在多个文本到视频主干模型上进行实验,并结合自演化策略,结果在ActVideoGen评估套件和VBench上均取得一致提升,证明了螺旋的有效性。
引用
@article{arxiv.2603.08403,
title = {SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents},
author = {Yu Yang and Yue Liao and Jianbiao Mei and Baisen Wang and Xuemeng Yang and Licheng Wen and Jiangning Zhang and Xiangtai Li and Liang Lv and Hanlin Chen and Botian Shi and Yong Liu and Shuicheng Yan and Gim Hee Lee},
journal= {arXiv preprint arXiv:2603.08403},
year = {2026}
}
备注
42 Pages, 21 Figures, Project page at https://yuyang-cloud.github.io/spiral