中文

大语言模型提示设计的复杂度分析为何有效

计算与语言 2025-06-03 v2

摘要

尽管大型语言模型 (LLM) 在各方面取得了显著的成功,但其底层 Transformer 架构在处理复杂推理任务方面存在固有的局限性。链律思考 (CoT) 提示方法已成为一种实用妥协方案,但大多数基于 CoT 的方法依赖于单一的通用提示,如“逐步思考”,且缺乏针对特定任务的调整。这些方法期望模型自行发现有效的推理路径,从而迫使其在广阔的提示空间中搜索。相比之下,一些研究已探索特定于任务的提示设计以提升性能。然而,这些设计通常通过试验发现,缺乏理论依据。结果是,提示工程主要是经验性的且缺乏指导。本文提供了一个理论框架,解释了某些提示为何成功而另一些为何失败。我们指出,提示充当了选择器,从 CoT 推理期间的模型完整隐藏状态中提取任务相关信息。每个提示定义了答案空间中的一个唯一轨迹,而轨迹的选择对于任务性能以及空间中未来导航至关重要。我们分析了寻找最优提示的复杂度,并刻画了给定任务提示空间的大小。我们的理论揭示了有效提示设计的原则,表明诸如“逐步思考”等 naïve CoT 自导式提示可能会严重阻碍性能。通过实验,我们展示,最优提示搜索可实现对推理任务超过 50% 的提升,为提示工程提供了理论基础。

关键词

引用

@article{arxiv.2503.10084,
  title  = {Why Prompt Design Matters and Works: A Complexity Analysis of Prompt Search Space in LLMs},
  author = {Xiang Zhang and Juntai Cao and Jiaqi Wei and Chenyu You and Dujian Ding},
  journal= {arXiv preprint arXiv:2503.10084},
  year   = {2025}
}

备注

ACL 2025 main conference