Kwai Keye-VL 1.5 技术报告
计算机视觉与模式识别
2025-09-09 v3
摘要
近年来,大语言模型 (LLM) 的发展取得了显著进展,并通过多模态大语言模型 (MLLM) 将其能力扩展至多模态任务。然而,由于视频的动态性和信息密集性,视频理解仍是一个充满挑战的领域。现有模型在处理视频内容时,难以在空间分辨率与时间覆盖率之间取得平衡。我们提出了 Keye-VL-1.5,通过三项关键创新来解决视频理解中的基础性挑战。首先,我们引入了一种新颖的 Slow-Fast 视频编码策略,该策略基于帧间相似度动态分配计算资源,以更高分辨率处理具有显著视觉变化的关键帧(Slow 路径),同时以更低分辨率处理相对静态的帧以提高时间覆盖率(Fast 路径)。其次,我们实现了一种渐进式四阶段预训练方法,将模型的上下文长度从 8K 系统性地扩展到 128K tokens,从而能够处理更长的视频和更复杂的视觉内容。第三,我们开发了一个综合性的训练后流水线,侧重于推理增强和人类偏好对齐,其中包含一个 5 步思维链数据构建过程、基于 GSPO 的迭代强化学习(针对困难案例采用渐进式提示)以及对齐训练。通过在公开基准上的广泛评估和严格的内部人工评估,Keye-VL-1.5 相较于现有模型展现出显著提升,尤其在视频理解任务中表现优异,同时在通用多模态基准上保持了具竞争力的性能。
引用
@article{arxiv.2509.01563,
title = {Kwai Keye-VL 1.5 Technical Report},
author = {Biao Yang and Bin Wen and Boyang Ding and Changyi Liu and Chenglong Chu and Chengru Song and Chongling Rao and Chuan Yi and Da Li and Dunju Zang and Fan Yang and Guorui Zhou and Guowang Zhang and Han Shen and Hao Peng and Haojie Ding and Hao Wang and Haonan Fan and Hengrui Ju and Jiaming Huang and Jiangxia Cao and Jiankang Chen and Jingyun Hua and Kaibing Chen and Kaiyu Jiang and Kaiyu Tang and Kun Gai and Muhao Wei and Qiang Wang and Ruitao Wang and Sen Na and Shengnan Zhang and Siyang Mao and Sui Huang and Tianke Zhang and Tingting Gao and Wei Chen and Wei Yuan and Xiangyu Wu and Xiao Hu and Xingyu Lu and Yi-Fan Zhang and Yiping Yang and Yulong Chen and Zeyi Lu and Zhenhua Wu and Zhixin Ling and Zhuoran Yang and Ziming Li and Di Xu and Haixuan Gao and Hang Li and Jing Wang and Lejian Ren and Qigen Hu and Qianqian Wang and Shiyao Wang and Xinchen Luo and Yan Li and Yuhang Hu and Zixing Zhang},
journal= {arXiv preprint arXiv:2509.01563},
year = {2025}
}
备注
Github page: https://github.com/Kwai-Keye/Keye