中文

并非能力问题:Harness 灵敏度在 LLM Agent 层级中呈非单调

人工智能 2026-05-27 v1 计算与语言

摘要

在 LLM agent 部署中,普遍假设是更结构化的 harness 必然提升可靠性,且高能力模型需要更少的结构化指导——这共同暗示模型能力等级与最优 harness 复杂度之间存在单调的反关系。我们通过在 HEAT-24 上进行一次受控的 432 次实验,横跨六个模型、四个能力等级,测试三个 harness 条件(轻型、平衡、严格),来检验这一假设。我们的结果在两个方面否定了单调反关系。首先,针对评估的前沿聊天模型(Gemini 2.5 Flash),harness verbosity 的增加会使 VTSR 下降 29-38 个百分点——出现了 harness 复杂度悖论。其次,针对评估的前沿推理模型(Qwen3.5-122B,启用扩展思考),严格 harness 实现最高的 VTSR(91.7%)和最低的延迟,与预测的相反。受限等级内的 2B 模型(Gemma4:e2B)在所有 harness 条件下均达到 91.7% 的强开放等级稳定性。由于本研究中每个等级仅由单个模型代表,这些结果应解释为模型特定的观察;harness 灵敏度在所评估的模型中呈非单调,且严重取决于模型类型(聊天型 vs. 推理型)。我们引入六标签的失败分类法,表明 format_violation 在能力较强的模型失败中占主导,而 wrong_file 在低能力模型失败中占主导,我们推导出实用的方法感知 harness 选择指南。

关键词

引用

@article{arxiv.2605.26731,
  title  = {It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers},
  author = {Yong-eun Cho},
  journal= {arXiv preprint arXiv:2605.26731},
  year   = {2026}
}

备注

9 pages, 3 figures