中文

多轮交互,输出更优?迭代式 LLM 提示的逐轮分析

人工智能 2025-09-16 v2 人机交互

摘要

大型语言模型(LLM)目前已被用于多轮工作流中,但我们仍然缺乏明确的方法来衡量何时迭代有益、何时有害。我们提出了一个涵盖构思、代码和数学领域的迭代精炼评估框架。我们的协议对每个任务运行受控的 12 轮对话,使用从模糊的“改进它”反馈到针对性引导的各种提示,并记录每轮的输出。我们使用领域适当的检查(代码使用单元测试;数学使用答案等价性加推理合理性;构思使用原创性与可行性)对结果进行评分,并用三族指标跟踪轮次级行为:跨轮次的语义移动、轮次间的变化以及输出规模的增长。跨模型和任务来看,增益依赖于领域:它们在构思和代码中较早出现,但在数学中,在详细阐述的引导下,后期轮次至关重要。在前几轮之后,模糊反馈通常会使正确性停滞或逆转,而针对性提示能可靠地改变预期的质量轴(构思中的新颖性与可行性;代码中的速度与可读性;在数学中,详细阐述优于探索并驱动后期轮次的增益)。我们还观察到一致的领域模式:构思在跨轮次中意义变化更大,代码倾向于规模增长而语义变化很小,而数学起初固定,但可以通过后期的详细阐述迭代打破该路径。综合来看,该框架和指标使迭代变得可衡量且可跨模型比较,并指示何时该引导、停止或切换策略。

关键词

引用

@article{arxiv.2509.06770,
  title  = {Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting},
  author = {Shashidhar Reddy Javaji and Bhavul Gauri and Zining Zhu},
  journal= {arXiv preprint arXiv:2509.06770},
  year   = {2025}
}