中文

渐进提示法提升大语言模型的推理能力

计算与语言 2024-10-08 v6 机器学习

摘要

大语言模型(LLMs)在推理任务中的表现高度依赖于提示设计,其中思维链(CoT)和自我一致性是关键且能增强该能力的方法。然而,这些方法并未充分利用LLM生成的答案来引导后续响应。本文提出一种名为渐进提示法(Progressive-Hint Prompting, PHP)的新提示方法,它通过将先前生成的答案作为提示,实现用户与LLM之间的自动多次交互,逐步引导至正确答案。PHP与CoT和自我一致性正交,因此易于与最先进技术结合以进一步提升性能。我们在七个基准上进行了广泛而全面的实验。结果表明,PHP在保持高效率的同时显著提高了准确率。例如,使用text-davinci-003时,相较于Complex CoT,我们在贪婪解码下于GSM8K上观察到4.2%的提升,并在自我一致性下使采样路径减少46.17%。借助GPT-4与PHP,我们在SVAMP(89.1% -> 91.9%)、GSM8K(92% -> 95.5%)、AQuA(76.4% -> 79.9%)和MATH(50.3% -> 53.9%)上取得了最先进的性能。

关键词

引用

@article{arxiv.2304.09797,
  title  = {Progressive-Hint Prompting Improves Reasoning in Large Language Models},
  author = {Chuanyang Zheng and Zhengying Liu and Enze Xie and Zhenguo Li and Yu Li},
  journal= {arXiv preprint arXiv:2304.09797},
  year   = {2024}
}

备注

Accepted to ICML AI4MATH 2024