中文

基于有效反馈计算的代理束架扩展规律

计算与语言 2026-05-29 v1

摘要

代理束架越来越重要地决定语言模型系统的性能,其通过决定模型如何调用工具、接收反馈、验证中间状态、存储记忆和修订解决方案。然而,当前的测试时扩展分析常以原始支出——标记、工具调用、操作、运行时间或成本——对该过程进行参数化,这并不区分有用的反馈与冗余或不稳定的交互。我们引入了\emph{有效反馈计算}(Effective Feedback Compute,EFC),这是一种基于跟踪级别的扩展坐标,仅在反馈在formativ、有效、非冗余且被保留用于后续决策时才给予积分,并通过归一化任务需求来比较不同反馈要求的任务。对于合成可控任务、可执行代码任务、真实基准轨迹、 held-out 分组和前瞻性验证批,EFC 基于坐标 consistently predict failure rates better than raw-compute baselines and a strong multivariate SAS baseline。在受控扩展中,raw tokens and tool calls 解释的变异有限(R2=0.33R^2=0.330.420.42),SAS 达到 0.880.88,而 Oracle-EFC 和 Estimated-EFC 分别达到 0.940.940.990.99。匹配预算干预显示,改善反馈质量在 raw cost 和 tool calls 固定的情况下将成功率从 0.270.27 提升到 0.900.90。在混合真实轨迹上,NRS-EFC/DtaskD_{\mathrm{task}} 达到 R2=0.92R^2=0.92,而 raw compute 的拟合为近零或负值,它仍是最佳预测器于前瞻性持留组中(R2=0.85R^2=0.85)。这些结果表明,代理束架的扩展更多取决于如何将原始计算资源有效地转换为持久、任务足够的反馈。

关键词

引用

@article{arxiv.2605.29682,
  title  = {Scaling Laws for Agent Harnesses via Effective Feedback Compute},
  author = {Xuanliang Zhang and Dingzirui Wang and Keyan Xu and Qingfu Zhu and Wanxiang Che},
  journal= {arXiv preprint arXiv:2605.29682},
  year   = {2026}
}