中文

独立抽样在代理推理优于情境

机器学习 2026-05-12 v1

摘要

我们研究在固定预算下如何分配推理计算用于竞赛编程。我们评估了216个Codeforces问题(跨越1-3组别),比较了基于代理的推理与重复独立抽样(k-shot)在不同成本和模型调用次数下的表现。在各种模型和难度水平下,k-shot在准确率-成本和准确率-查询权衡方面始终实现更好的效果。尽管代理框架中存在提示缓存,此差距仍然存在,表明每次调用的有效性更低。我们的结果表明,在自包含算法任务中,在现实资源约束下,独立探索可以超过更深入的代理推理。我们还提供了在推理预算固定时的预算分配分析,并证明了最小化每美元对数失败概率的成本最优求解器。

关键词

引用

@article{arxiv.2605.08478,
  title  = {When Independent Sampling Outperforms Agentic Reasoning},
  author = {Yihe Dong and Boris Shigida},
  journal= {arXiv preprint arXiv:2605.08478},
  year   = {2026}
}