中文

Kling-Omni 技术报告

计算机视觉与模式识别 2025-12-19 v1

摘要

我们提出了 Kling-Omni,一个旨在直接从多模态视觉语言输入合成高保真视频的通用生成框架。采用端到端视角,Kling-Omni 弥合了多样化视频生成、编辑和智能推理任务之间的功能分离,将它们整合为一个整体系统。与碎片化的流水线方法不同,Kling-Omni 支持多样化的用户输入,包括文本指令、参考图像和视频上下文,将它们处理为统一的多模态表示,以提供电影级和高度智能的视频内容创作能力。为了支持这些能力,我们构建了一个全面的数据系统,作为多模态视频创作的基础。该框架还通过高效的大规模预训练策略和推理基础设施优化得到增强。全面评估表明,Kling-Omni 在上下文内生成、基于推理的编辑和多模态指令遵循方面表现出卓越能力。超越内容创作工具,我们相信 Kling-Omni 是迈向能够感知、推理、生成并与动态和复杂世界交互的多模态世界模拟器的关键进展。

关键词

引用

@article{arxiv.2512.16776,
  title  = {Kling-Omni Technical Report},
  author = {Kling Team and Jialu Chen and Yuanzheng Ci and Xiangyu Du and Zipeng Feng and Kun Gai and Sainan Guo and Feng Han and Jingbin He and Kang He and Xiao Hu and Xiaohua Hu and Boyuan Jiang and Fangyuan Kong and Hang Li and Jie Li and Qingyu Li and Shen Li and Xiaohan Li and Yan Li and Jiajun Liang and Borui Liao and Yiqiao Liao and Weihong Lin and Quande Liu and Xiaokun Liu and Yilun Liu and Yuliang Liu and Shun Lu and Hangyu Mao and Yunyao Mao and Haodong Ouyang and Wenyu Qin and Wanqi Shi and Xiaoyu Shi and Lianghao Su and Haozhi Sun and Peiqin Sun and Pengfei Wan and Chao Wang and Chenyu Wang and Meng Wang and Qiulin Wang and Runqi Wang and Xintao Wang and Xuebo Wang and Zekun Wang and Min Wei and Tiancheng Wen and Guohao Wu and Xiaoshi Wu and Zhenhua Wu and Da Xie and Yingtong Xiong and Yulong Xu and Sile Yang and Zikang Yang and Weicai Ye and Ziyang Yuan and Shenglong Zhang and Shuaiyu Zhang and Yuanxing Zhang and Yufan Zhang and Wenzheng Zhao and Ruiliang Zhou and Yan Zhou and Guosheng Zhu and Yongjie Zhu},
  journal= {arXiv preprint arXiv:2512.16776},
  year   = {2025}
}

备注

Kling-Omni Technical Report