中文

RubricRefine:通过免训练执行前优化提升工具使用智能体的可靠性

机器学习 2026-05-19 v3 软件工程

摘要

迭代自优化是一种流行的推理时可靠性技术,但其在代码模式工具使用中的有效性严重依赖于反馈信号的结构:非结构化的批评在不同模型上效果不一,甚至使用真实执行反馈进行修订也仅带来微小的提升(0.750.75 对比 0.650.65 基线)。主要的失败是工具间契约违规(错误的输出形状、不正确的工具路由、破坏的参数来源),这些违规在运行完成时不会引发错误,使得运行时反馈不足。我们引入了 RubricRefine,一种用于执行前语义契约验证的免训练方法,它生成特定于任务和注册表的评分标准,根据显式契约检查对候选代码进行评分,并在任何执行发生之前迭代修复失败。RubricRefine 在 M3ToolEval 上达到 0.860.86(七个模型的平均值),且执行尝试为零,优于先前的推理时基线,延迟降低达 2.6×2.6\times。在以单步为主的 API-Bank 上性能保持平稳,这与该方法对工具间契约结构的依赖相一致。评分标准类别消融和校准分析进一步刻画了该方法何时以及为何有效。

关键词

引用

@article{arxiv.2605.09730,
  title  = {RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement},
  author = {Will LeVine and Brendan Evers and Sam Saltwick and Abhay Venkatesh},
  journal= {arXiv preprint arXiv:2605.09730},
  year   = {2026}
}