ACC:用于长上下文训练的智能体轨迹编译
计算与语言
2026-05-22 v1 人工智能
摘要
智能体的近期发展重新放大了大语言模型(LLM)长程推理能力的需求。然而,为此项能力训练 LLM 需要昂贵的长文档策划或启发式的上下文合成。我们观察到,智能体在解决问题时会产生大量轨迹,调用工具并在多个回合中接收环境观察。因此,回答原问题所需的证据散布在这些回合中,要求对遥远的上下文片段进行整合。然而,标准的智能体监督微调(SFT)会屏蔽工具响应,仅训练回合级别的工具选择,导致这些分散信号未被利用。我们提出了智能体上下文编译(ACC),将搜索、软件工程和数据库查询等智能体的轨迹转换为包含原始问题与跨多个回合收集的工具响应和环境观察的长上下文问答对,训练模型在不使用工具的情况下直接回答问题。这使得问题与证据之间的依赖关系变得显式,使无需额外标注即可对遥远片段的长程推理进行直接监督。ACC 是一种简单而有效的方法,可与任何现有的长程上下文扩展方法或训练方法结合,提供可扩展的监督式微调数据。我们在 MRCR 和 GraphWalks 两个需要跨回合指代消解和图遍历的挑战性基准上验证了 ACC。使用 ACC 训练的 Qwen3-30B-A3B 在 MRCR 上取得68.3分(提升18.1分),在 GraphWalks 上取得77.5分(提升7.6分),成绩相当于 Qwen3-235B-A22B,同时在 GPQA、MMLU-Pro、AIME 和 IFEval 上保持通用能力。进一步的机制分析表明,ACC 训练的模型表现出任务适应性的注意力重构和专家专业化。
引用
@article{arxiv.2605.21850,
title = {ACC: Compiling Agent Trajectories for Long-Context Training},
author = {Qisheng Su and Zhen Fang and Shiting Huang and Yu Zeng and Yiming Zhao and Kou Shi and Ziao Zhang and Lin Chen and Zehui Chen and Lijun Wu and Feng Zhao},
journal= {arXiv preprint arXiv:2605.21850},
year = {2026}
}