中文

UnityVideo:用于提升世界感知视频生成的统一多模态多任务学习

计算机视觉与模式识别 2025-12-09 v1

摘要

最近的视频生成模型展现了惊人的合成能力,但仍受限于单一模态条件,限制了其整体世界理解能力。这源于跨模态相互作用不足以及模态多样性有限,无法进行全面世界知识的表征。为此,本文引入 UnityVideo,一个实现世界感知视频生成的统一框架,通过跨多个模态(分割掩码、人体骨架、DensePose、光流和深度图)和训练范式进行联合学习。我们的方法包含两个核心组件:(1)动态加噪以统一异构训练范式,(2)具备情境学习能力的模态切换器,通过模块化参数和情境学习实现统一处理。我们贡献了一个包含130万样本的大规模统一数据集。通过联合优化,UnityVideo 加速收敛,并显著提升了对未见数据的数据零样本泛化能力。我们展示了 UnityVideo 在视频质量、一致性以及与物理世界约束的对齐方面均取得优异成绩。代码和数据可在 https://github.com/dvlab-research/UnityVideo 查阅。

关键词

引用

@article{arxiv.2512.07831,
  title  = {UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation},
  author = {Jiehui Huang and Yuechen Zhang and Xu He and Yuan Gao and Zhi Cen and Bin Xia and Yan Zhou and Xin Tao and Pengfei Wan and Jiaya Jia},
  journal= {arXiv preprint arXiv:2512.07831},
  year   = {2025}
}

备注

Project Website https://jackailab.github.io/Projects/UnityVideo