中文

Kwai Keye-VL技术报告

计算机视觉与模式识别 2025-07-03 v1

摘要

虽然多模态大语言模型(MLLM)在处理静态图像方面表现突出,但往往在理解动态信息密集型短视频方面不足,这是当今数字时代的主流媒介。为弥合这一差距,我们引入了"Kwai Keye-VL"——一个80亿参数的多模态基础模型,专为在短视频理解中实现领先性能,同时保持强大的通用视觉语言能力。Keye-VL的开发建立在两个核心支柱之上:规模化、高质量的数据集(超过6000亿token),以及强烈的视频数据倾斜,以及创新的训练配方。该配方包括四阶段预训练以实现稳健的视觉语言对齐,随后是精细挑选的两个后训练阶段。第一个后训练阶段增强了指令遵循等基础能力,而第二个阶段则聚焦于激发高级推理能力。在第二个阶段,一个关键创新是我们五模式"cold-start"数据混合,包括"thinking"、"non-thinking"、"auto-think"、"think with image"和高质量视频数据。该混合训练模型何时以及如何进行推理。随后采用强化学习(RL)和对齐步骤进一步提升这些推理能力并纠正异常行为,如重复输出。为验证我们的做法,我们进行了广泛的评估,表明Keye-VL在公共视频基准测试中实现了最先进的结果,在一般基于图像的任务中也保持高度竞争力(图1)。此外,我们开发并发布了"KC-MMBench"——一个针对真实世界短视频场景的新基准,Keye-VL在此基准上显示出显著优势。

关键词

引用

@article{arxiv.2507.01949,
  title  = {Kwai Keye-VL Technical Report},
  author = {Kwai Keye Team and Biao Yang and Bin Wen and Changyi Liu and Chenglong Chu and Chengru Song and Chongling Rao and Chuan Yi and Da Li and Dunju Zang and Fan Yang and Guorui Zhou and Hao Peng and Haojie Ding and Jiaming Huang and Jiangxia Cao and Jiankang Chen and Jingyun Hua and Jin Ouyang and Kaibing Chen and Kaiyu Jiang and Kaiyu Tang and Kun Gai and Shengnan Zhang and Siyang Mao and Sui Huang and Tianke Zhang and Tingting Gao and Wei Chen and Wei Yuan and Xiangyu Wu and Xiao Hu and Xingyu Lu and Yang Zhou and Yi-Fan Zhang and Yiping Yang and Yulong Chen and Zhenhua Wu and Zhenyu Li and Zhixin Ling and Ziming Li and Dehua Ma and Di Xu and Haixuan Gao and Hang Li and Jiawei Guo and Jing Wang and Lejian Ren and Muhao Wei and Qianqian Wang and Qigen Hu and Shiyao Wang and Tao Yu and Xinchen Luo and Yan Li and Yiming Liang and Yuhang Hu and Zeyi Lu and Zhuoran Yang and Zixing Zhang},
  journal= {arXiv preprint arXiv:2507.01949},
  year   = {2025}
}

备注

Technical Report: https://github.com/Kwai-Keye/Keye