Plan-X:基于语义规划的指令视频生成
计算机视觉与模式识别
2025-11-25 v1 人工智能
摘要
扩散变换器在视觉合成方面展现出显著能力,但常在高层语义推理和长程规划方面受限。这一限制常导致视觉幻觉和指令对齐失调,尤其在涉及复杂场景理解、人物-物体交互、多阶段动作及情境运动推理的情境下更为明显。为此,我们提出Plan-X框架,通过显式语义规划来指导视频生成过程。其核心为语义规划器(Semantic Planner),一种可学习的多模态语言模型,能够从文本提示和视觉上下文中推理用户意图,并自回归生成一序列文本 grounding 的时空语义标记。这些语义标记辅助高层文本提示,作为视频扩散模型的时间结构化“语义草图”,而扩散模型擅长合成高保真视觉细节。Plan-X有效整合了语言模型在多模态情境推理与规划方面的优势,以及扩散模型在照片实在视频合成方面的优势。大量实验表明,我们的框架显著降低了视觉幻觉,实现了细粒度、指令对齐且符合多模态上下文的视频生成。
引用
@article{arxiv.2511.17986,
title = {Plan-X: Instruct Video Generation via Semantic Planning},
author = {Lun Huang and You Xie and Hongyi Xu and Tianpei Gu and Chenxu Zhang and Guoxian Song and Zenan Li and Xiaochen Zhao and Linjie Luo and Guillermo Sapiro},
journal= {arXiv preprint arXiv:2511.17986},
year = {2025}
}
备注
The project page is at https://byteaigc.github.io/Plan-X