中文

OmniWeaving:面向统一视频生成的自由式组合与推理能力

计算机视觉与模式识别 2026-04-03 v2

摘要

虽然专有系统如 Seedance-2.0 在全能视频生成方面取得了显著成功,但开源替代方案显著落后于人类。大多数学术模型仍高度碎片化,少数旨在实现统一视频生成的努力仍难在单一框架内无缝集成多样任务。为填补这一差距,我们提出了 OmniWeaving,一个具备强大多模态组合与推理能力的全能级视频生成模型。通过利用涵盖多样组合和推理增强场景的大规模预训练数据集,OmniWeaving 学习在时间上将交错的文本、多图像和视频输入绑定在一起,充当智能代理以推断复杂用户意图以实现高级视频创作。此外,我们引入了 IntelligentVBench,第一个旨在严格评估下一代智能统一视频生成的全面基准测试。大量实验表明,OmniWeaving 在开源统一模型中实现了 SoTA 性能。代码和模型已公开可用。项目页面:https://omniweaving.github.io。

关键词

引用

@article{arxiv.2603.24458,
  title  = {OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning},
  author = {Kaihang Pan and Qi Tian and Jianwei Zhang and Weijie Kong and Jiangfeng Xiong and Yanxin Long and Shixue Zhang and Haiyi Qiu and Tan Wang and Zheqi Lv and Yue Wu and Liefeng Bo and Siliang Tang and Zhao Zhong},
  journal= {arXiv preprint arXiv:2603.24458},
  year   = {2026}
}

备注

32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving