AutoHarness:通过自动合成代码编织器来提高 LLM 代理性能
计算与语言
2026-03-05 v1 人工智能
摘要
尽管近年来语言模型取得了显著进展,但作为代理使用时,这些模型常常会尝试执行外部环境禁止的动作。例如,在最近的 Kaggle GameArena 国际象棋比赛中,78% 的 Gemini-2.5-Flash 损失归因于非法走子。人们通常会手动编写围绕 LLM 的“编织器”以防止此类错误。本文展示了 Gemini-2.5-Flash 能够自动合成此类代码编织器,仅需通过少量迭代代码细化并获得(游戏)环境的反馈。生成的编织器在 145 个不同的 TextArena 游戏(包括单人和双人)中阻止了所有非法走子,使较小的 Gemini-2.5-Flash 模型能够战胜更大的模型,如 Gemini-2.5-Pro。将我们的技术推向极限,我们可以让 Gemini-2.5-Flash 生成整个策略,从而在决策制定时无需使用 LLM。该代码策略在 16 个 TextArena 单人游戏中平均奖励值均高于 Gemini-2.5-Pro 和 GPT-5.2-High。我们的结果表明,使用较小的模型合成自定义代码编织器(或整个策略)能够超越更大模型,同时也更具成本效益。
引用
@article{arxiv.2603.03329,
title = {AutoHarness: improving LLM agents by automatically synthesizing a code harness},
author = {Xinghua Lou and Miguel Lázaro-Gredilla and Antoine Dedieu and Carter Wendelken and Wolfgang Lehrach and Kevin P. Murphy},
journal= {arXiv preprint arXiv:2603.03329},
year = {2026}
}
备注
agent harness, code synthesis, self-improvement, code-as-policy, text games