中文

大语言模型的提示强化用于长期计划

计算与语言 2026-05-19 v3 机器学习

摘要

大语言模型(LLMs)在广泛的自然语言处理任务中取得了显著的成功,可以通过提示进行适应。然而,它们在多轮交互中仍显得不够理想,往往依赖于错误的早期假设,无法持续跟踪用户目标,这使得此类任务尤为具有挑战性。对话系统的先前工作表明,长期计划对于处理交互式任务至关重要。在本工作中,我们提出了一种受强化学习启发的提示优化框架,通过仅修改 LLM 基于智能体的任务指令提示,使此类计划得以实现。通过生成逐轮反馈并利用经验回放进行提示重写,我们提出的方法在诸如文本到 SQL 和任务导向对话等多轮任务中显示出显著的改进。此外,它能够跨越不同的 LLM 基于智能体,并可利用多样化的 LLM 作为元提示智能体。这为基于强化学习启发的参数自由优化方法的未来研究提供了依据。

关键词

引用

@article{arxiv.2510.05921,
  title  = {Prompt reinforcing for long-term planning of large language models},
  author = {Hsien-Chin Lin and Benjamin Matthias Ruppik and Carel van Niekerk and Chia-Hao Shen and Michael Heck and Nurul Lubis and Renato Vukovic and Shutong Feng and Milica Gašić},
  journal= {arXiv preprint arXiv:2510.05921},
  year   = {2026}
}