大语言模型思维链提示的压测分析
计算与语言
2023-09-29 v1 人工智能
摘要
本报告考察了思维链(Chain-of-Thought, CoT)提示在提升大语言模型(LLMs)多步推理能力方面的有效性。受先前研究 \cite{Min2022RethinkingWork} 启发,我们分析了三类 CoT 提示扰动(即 CoT 顺序、CoT 数值与 CoT 算子)对 GPT-3 在多种任务上性能的影响。我们的发现表明,错误的 CoT 提示会导致准确率指标上的糟糕表现。CoT 中正确的数值对于预测正确答案至关重要。此外,与基于数值的扰动相比,CoT 算子或 CoT 顺序错误的错误示例对性能的影响并不那么剧烈。本研究深化了我们对 CoT 提示的理解,并提出了关于 LLMs 在上下文中学习推理能力的一些新问题。
引用
@article{arxiv.2309.16621,
title = {Stress Testing Chain-of-Thought Prompting for Large Language Models},
author = {Aayush Mishra and Karan Thakkar},
journal= {arXiv preprint arXiv:2309.16621},
year = {2023}
}