KLong:用于极长时程任务的 LLM Agent 训练
人工智能
2026-04-28 v3 计算与语言
摘要
本文介绍KLong,这是一个开源的 LLM agent,用于解决极长时程任务。其核心原理是先通过轨迹分割专家微调(trajectory-splitting SFT)进行冷启动,然后通过渐进式强化学习进行规模化训练。具体而言,我们首先通过全面的 SFT 配方激活基础模型的基本 agent 能力。随后,我们引入Research-Factory,一个自动化管道,通过收集研究论文并构建评估评语来生成高质量训练数据。借助该管道,我们构建了数千条由 Claude 4.5 Sonnet(Thinking)提炼而来的长时程轨迹。为训练这些极长轨迹,我们提出了一种新的轨迹分割 SFT,该方法保留早期上下文,逐步截断后期上下文,并维持子轨迹之间的重叠。在此基础上,为进一步提升长时程任务解决能力,我们提出了一种新颖的渐进式强化学习方法,该方法将训练分为多个阶段,时间限制逐渐延长。实验表明,KLong 在各项指标上均优于并具有良好概括性,如图1所示。值得注意的是,我们提出的KLong(106B)在PaperBench 上超越了Kimi K2 Thinking(1T),超过11.28%,性能提升也适用于其他编码基准,如SWE-bench Verified和MLE-bench。
引用
@article{arxiv.2602.17547,
title = {KLong: Training LLM Agent for Extremely Long-horizon Tasks},
author = {Yue Liu and Yingwei Ma and Yibo Miao and Yanhao Li and Yuchong Xie and Xinlong Yang and Zhiyuan Hu and Flood Sung and Jiaheng Zhang and Bryan Hooi},
journal= {arXiv preprint arXiv:2602.17547},
year = {2026}
}
备注
We request standard withdrawal of this submission because significant errors were discovered in the data after submission, which affect the validity of the results. We may submit a corrected version later