中文

SHERPA:一种模型驱动的大型语言模型执行框架

人工智能 2025-09-03 v1 软件工程

摘要

近期,大型语言模型(LLMs)在各个领域获得了广泛应用。尽管 LLMs 具有令人印象深刻的能力,但它们缺乏结构化推理能力,特别是对于需要特定领域最佳实践的复杂任务,而这些实践在训练数据中通常不可用。尽管结合人类最佳实践的多步提示方法(如思维链和思维树)已受到欢迎,但它们缺乏控制 LLM 行为的通用机制。在本文中,我们提出了 SHERPA,一种模型驱动框架,通过将特定领域最佳实践显式纳入分层状态机来提升 LLM 在复杂任务上的表现。通过使用状态机构建 LLM 执行过程,SHERPA 能够通过规则或由基于机器学习的方法(包括 LLMs)驱动的决策,对其行为进行更细粒度的控制。我们表明 SHERPA 适用于多种任务——具体而言,代码生成、类名生成和问答——它复现了先前提出的方法并进一步提升了性能。我们使用各种 LLMs 展示了 SHERPA 在上述任务中的有效性。我们的系统评估将不同的状态机配置与无状态机的基线方法进行了比较。结果表明,集成设计良好的状态机可显著提高 LLM 输出的质量,并且对于具有成熟人类最佳实践但缺乏用于训练 LLMs 数据的复杂任务尤为有益。

关键词

引用

@article{arxiv.2509.00272,
  title  = {SHERPA: A Model-Driven Framework for Large Language Model Execution},
  author = {Boqi Chen and Kua Chen and José Antonio Hernández López and Gunter Mussbacher and Dániel Varró and Amir Feizpour},
  journal= {arXiv preprint arXiv:2509.00272},
  year   = {2025}
}

备注

MODELS 2025