中文

Video-As-Prompt:视频生成的统一语义控制

计算机视觉与模式识别 2025-10-27 v1 人工智能

摘要

视频生成中统一且可泛化的语义控制仍是一个关键未解决挑战。现有方法要么通过强制不当的像素级先验(来自基于结构的控制)引入伪影,要么依赖非泛化的、特定条件的微调或任务特定的体系结构。我们提出Video-As-Prompt(VAP)新范式,将此问题重新框定为上下文生成。VAP利用参考视频作为直接语义提示,引导冻结的Video Diffusion Transformer(DiT)通过即插即用的混合Transformer(MoT)专家实现控制。该架构可防止灾难性遗忘,并由时序偏置位置嵌入引导,消除对稳健上下文检索的伪映射偏差。为支撑这一方法并催化未来研究,我们构建了VAP-Data,规模最大的语义控制视频生成数据集,包含超过10万对视频,覆盖100种语义条件。作为单一统一模型,VAP为开源方法树立了新的最高水平,实现38.7%的用户偏好率,与领先的特定条件商业模型不相上下。VAP的强大零样本泛化能力及其对多种下游应用的支持,标志着通用可控视频生成的重大进展。

关键词

引用

@article{arxiv.2510.20888,
  title  = {Video-As-Prompt: Unified Semantic Control for Video Generation},
  author = {Yuxuan Bian and Xin Chen and Zenan Li and Tiancheng Zhi and Shen Sang and Linjie Luo and Qiang Xu},
  journal= {arXiv preprint arXiv:2510.20888},
  year   = {2025}
}

备注

Website: https://bytedance.github.io/Video-As-Prompt