基于经验迭代蒸馏的黑盒LLM多步推理与工具使用提示策略
人工智能
2026-05-15 v1 机器学习
多智能体系统
摘要
向与冻结的“黑盒”大语言模型(LLM)交互的转变,已将提示工程从一种启发式尝试转变为一个关键的优化挑战。我们提出了一个强化学习(RL)框架,通过经验的迭代蒸馏来训练学习到的提示策略。在该架构中,一个轻量级提示模型被优化,以最大化一个更大且冻结的工作LLM的任务特定奖励。通过利用将标量奖励与密集文本批评相结合的对比经验缓冲区,我们的方法有效地将迭代提示细化摊销为单次策略权重。我们的实验分析集中在Big Bench Extra Hard(BBEH)和Tau-bench套件上,涵盖了各种多步推理和工具使用任务。我们展示了显著的收益,在逻辑密集型推理中将性能从55%提高到90%,在工具使用任务中从74%提高到91%。此外,我们分析了提示的结构演化,展示了策略如何发现专门的算法启发式方法。我们提供了与GEPA等最先进的进化基线的全面比较,表明迭代蒸馏以更高的样本效率实现了卓越的性能。
引用
@article{arxiv.2605.14443,
title = {Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience},
author = {Krishna Sayana and Ketan Todi and Ambarish Jash},
journal= {arXiv preprint arXiv:2605.14443},
year = {2026}
}
备注
10 pages and reference, appendix