KAT-V1:Kwai-AutoThink 技术报告
计算与语言
2025-07-22 v3
摘要
我们提出 Kwaipilot-AutoThink (KAT),这是一款开源 40B 超大规模语言模型,旨在解决推理密集型任务中的过度思考问题。我们提出了一种自动思考训练范式,能够根据任务复杂度动态切换推理与非推理模式。具体而言,我们首先基于新颖的标记管线和多智能体合成策略构建了双模式数据集,然后应用增强型多标记预测 (MTP) 知识蒸馏,实现了高效、细粒度的推理传递,同时保持最小的预训练成本。此外,我们实现了冷启动初始化策略,通过多数投票信号和意图感知式提示引入模式选择先验。最后,我们提出了 Step-SRPO,这是一种融合中间监督于 GRPO 框架内的强化学习算法,为推理模式选择和响应准确性提供结构化指导。广泛的实验表明,KAT 在多种基准测试中与当前最先进模型(包括 DeepSeek-R1-0528 和 Qwen3-235B-A22B)一致甚至优于,同时显著降低了 token 使用量。值得注意的是,KAT 在控制泄漏的 LiveCodeBench Pro 上超越了所有开源模型,甚至超过了 o3-mini。Beyond 学术评估,KAT 已成功部署于 Kuaipilot(即快手的内部编码助手)中,提升了实际开发工作流程的准确率、效率和可控推理行为。我们正在积极训练一款 200B Mixture-of-Experts (MoE) 模型,40B 活跃参数,初步结果已显示出显著的提升,进一步证明了 AutoThink 范式的可扩展性。
引用
@article{arxiv.2507.08297,
title = {KAT-V1: Kwai-AutoThink Technical Report},
author = {Zizheng Zhan and Ken Deng and Huaixi Tang and Wen Xiang and Kun Wu and Weihao Li and Wenqiang Zhu and Jingxuan Xu and Lecheng Huang and Zongxian Feng and Shaojie Wang and Shangpeng Yan and Xuxing Chen and Jiaheng Liu and Zhongyuan Peng and Zuchen Gao and Haoyang Huang and Xiaojiang Zhang and Jinghui Wang and Zheng Lin and Mengtong Li and Huiming Wang and Ziqi Zhan and Yanan Wu and Yuanxing Zhang and Jian Yang and Guang Chen and Haotian Zhang and Bin Chen and Bing Yu},
journal= {arXiv preprint arXiv:2507.08297},
year = {2025}
}