中文

面向文件原生代理系统的结构化上下文工程:评估模式准确性、格式效果和大规模多文件导航

机器学习 2026-05-26 v4

摘要

大型语言模型代理越来越多地通过程序化接口操作外部系统,但实践者缺乏关于如何结构化这些代理消耗的上下文的经验指导。我们以 SQL 生成为程序化代理操作的代理,系统性地研究了结构化数据的上下文工程,涵盖 9,649 项实验,涉及 11 个模型、4 种格式 (YAML、Markdown、JSON、Token-Oriented Object Notation [TOON]) 以及模式范围从 10 到 10,000 张表。我们的发现挑战了常见假设:1. 架构选择取决于模型:文件基上下文检索对面向未来tier 的模型 (Claude、GPT、Gemini;+2.7%,p=0.029) 有效,但对开源模型 (aggregate -7.7%,p<0.001) 结果不一,缺口因模型而异。2. 格式对整体准确率影响不大 (chi-squared=2.45,p=0.484),但个别模型,特别是开源模型, exhibit format-specific sensitivities。3. 模型能力是决定因素,前沿和开源tier 之间存在 21 个百分点的准确率差距,远超任何格式或架构效应。4. 文件原生代理通过领域分区模式扩展到 10,000 张表,同时保持高导航准确率。5. 文件大小不预测运行效率:紧凑或新颖格式可能因 grep 输出密度和模式不熟悉导致 token 开销,规模取决于模型能力。这些发现为在结构化系统上部署 LLM 代理提供了基于证据的指导,表明架构决策应针对模型能力进行调优,而非假设存在通用最佳实践。

关键词

引用

@article{arxiv.2602.05448,
  title  = {BlitzRank: Principled Zero-shot Ranking Agents with Tournament Graphs},
  author = {Sheshansh Agrawal and Thien Hang Nguyen and Douwe Kiela},
  journal= {arXiv preprint arXiv:2602.05448},
  year   = {2026}
}

备注

ICML 2026 spotlight