中文

ExecTune:针对黑箱大语言模型的有效引导模型

机器学习 2026-04-14 v1 人工智能

摘要

对于通过黑箱API部署的大型语言模型,推理成本往往超过一次性训练成本。这激励了由可重用中间表示所构成的代理系统,以实现昂贵推理的摊销。我们研究了一类此类系统,称为指导-核心策略 (Guide-Core Policies, GCoP),其中指导模型生成结构化策略,由黑箱核心模型执行。该抽象包含基本模型、监督式和顾问式方法,两者主要区别在于指导模型的训练方式。我们在成本敏感的效用目标下形式化GCoP,指出端到端性能由指导平均可执行性决定:即指导生成的策略能否被核心可靠执行的概率。我们的分析表明,现有GCoP实例常常在部署约束下未能优化可执行性,导致策略脆弱且计算效率低下。鉴于这些见解,我们提出ExecTune,一种原则化的训练配方,结合教师指导的接受抽样、监督微调和结构感知强化学习,直接优化语法有效性、执行成功率和成本效率。在数学推理和代码生成基准测试中,采用ExecTune的GCoP在先前最先进基准上准确率提升最高可达9.2%,同时推理成本降低最高可达22.4%。它使Claude Haiku 3.5在数学和代码任务上超越Sonnet 3.5,并在38%的低成本下接近Sonnet 4的准确率。除效率外,GCoP还支持通过更新指导模型而无需重新训练核心模型的模块化适应。

关键词

引用

@article{arxiv.2604.09741,
  title  = {ExecTune: Effective Steering of Black-Box LLMs with Guide Models},
  author = {Vijay Lingam and Aditya Golatkar and Anwesan Pal and Ben Vo and Narayanan Sadagopan and Alessandro Achille and Jun Huan and Anoop Deoras and Stefano Soatto},
  journal= {arXiv preprint arXiv:2604.09741},
  year   = {2026}
}

备注

Accepted at Lifelong Agents Workshop at ICLR 2026