中文

OPT-BENCH:评估大规模搜索空间中 LLM 代理的迭代自优化能力

人工智能 2026-05-12 v1

摘要

大语言模型(LLMs)在推理与工具使用方面展现出惊人的能力。然而,对于问题解决至关重要的认知 faculty,包括感知、推理和记忆,仍是智能的稳定核心。与记忆特定模式不同,人类能够通过应用这些内在 faculty 来适应和优化新环境,从而成功。然而,LLMs 是否具备这种基本能力——即能够根据动态环境反馈持续细化解决方案的能力——仍未得到充分探索。为此,我们引入了 OPT-BENCH,用于评估大规模搜索空间中自我改进能力的基准测试。通过将 20 个机器学习任务与 10 个经典 NP-hard 问题结合,OPT-BENCH 提供了严格的环境,以评估代理是否可以通过内在自我反思而非机械工具应用进行适应。我们进一步提出了 OPT-Agent,一种模拟人类类认知适应的框架。它通过通用的感知、记忆和推理循环运行,根据环境反馈迭代细化解决方案。在针对 19 个来自 7 个模型家族的 LLMs(包括推理模型、通用模型和参数从 3B 到 235B 的开源模型)进行的广泛实验表明,更强的模型在利用反馈信号进行自我改进方面更有效。然而,这种上限可适应性仍然受限于模型的基本能力,即使是最先进的 LLMs 也不足以达到人类专家水平。

关键词

引用

@article{arxiv.2605.08904,
  title  = {OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces},
  author = {Xiaozhe Li and Jixuan Chen and Xinyu Fang and Shengyuan Ding and Haodong Duan and Qingwen Liu and Kai Chen},
  journal= {arXiv preprint arXiv:2605.08904},
  year   = {2026}
}