通过统一导演器连接想象与音视频生成
计算机视觉与模式识别
2025-12-30 v1 多媒体
摘要
现有的 AI 驱动视频创建系统通常将脚本撰写和关键镜头设计视为两个独立任务:前者依赖大语言模型,后者依赖图像生成模型。我们认为,这两个任务应在单一框架内统一,因为逻辑推理与想象力是导演的基本素质。本文提出 UniMAGE,一个统一的导演模型,将用户提示与结构完整的脚本连接起来,从而借助现有的音视频生成模型,使非专业人士能够生成长时序、多镜头电影。为实现此目标,我们采用 Mixture-of-Transformers 架构统一文本和图像生成。为进一步增强叙事逻辑和关键帧一致性,我们引入“先交错,再解耦”训练范式。具体而言,我们首先进行交错概念学习(Interleaved Concept Learning),利用交错的文本-图像数据培养模型对脚本的更深入理解和想象性解释。随后进行解耦专家学习(Disentangled Expert Learning),将脚本编写与关键帧生成解耦,从而增强叙事的灵活性和创造性。大量实验表明,UniMAGE 在开源模型中实现了最先进的性能,生成逻辑连贯的视频脚本和视觉一致的关键帧图像。
引用
@article{arxiv.2512.23222,
title = {Bridging Your Imagination with Audio-Video Generation via a Unified Director},
author = {Jiaxu Zhang and Tianshu Hu and Yuan Zhang and Zenan Li and Linjie Luo and Guosheng Lin and Xin Chen},
journal= {arXiv preprint arXiv:2512.23222},
year = {2025}
}