中文

经验引导的推理策略自适应

人工智能 2025-11-17 v1 机器学习

摘要

使具备代理能力的 AI 系统能够基于训练后交互动态调整问题解决方法始终是一项根本性挑战。虽然已有研究提出在推理时更新和维护记忆的系统,但现有设计仅通过修改语言模型或智能体的文本输入来引导系统,无法改变抽样参数、移除工具、修改系统提示,或在代理范式与工作流范式之间切换。另一方面,更灵活的适应性系统需要离线优化,且部署后保持静态。我们提出经验引导的推理者(EGuR),它基于累积的经验在推理时生成量身定制的策略——包括 LLM 调用、工具、抽样参数和控制逻辑的完整计算程序。我们通过基于 LLM 的元策略实现这一目标,即输出策略的策略,使所有策略组件(提示、抽样参数、工具配置和控制逻辑)均可适应。EGuR 包含两个组件:指南器根据当前问题和结构化的过去经验记忆生成多个备选策略,而整合器则整合执行反馈以改进未来的策略生成。产生的完整、即插即用策略针对每个问题进行优化,可被缓存、检索和执行,而无需浪费资源。在五个具有挑战性的基准测试(AIME 2025、3-SAT 以及三个 Big Bench Extra Hard 任务)上,EGuR 相比最强基线实现了最高 14% 的准确率提升,同时将计算成本降低最高 111 倍,随着系统积累经验,两项指标均实现提升。

关键词

引用

@article{arxiv.2511.11519,
  title  = {Experience-Guided Adaptation of Inference-Time Reasoning Strategies},
  author = {Adam Stein and Matthew Trager and Benjamin Bowman and Michael Kleinman and Aditya Chattopadhyay and Wei Xia and Stefano Soatto},
  journal= {arXiv preprint arXiv:2511.11519},
  year   = {2025}
}

备注

29 pages, 5 figures