战略性思维链:通过策略引导 LLMs 中的准确推理
人工智能
2024-09-06 v1 计算与语言
人机交互
摘要
思维链 范式已成为增强大型语言模型 推理能力的关键方法。然而,尽管 CoT 方法被广泛采用并取得成功,但由于无法始终确保生成推理路径的质量,它们通常表现出不稳定性,导致推理性能次优。为了应对这一挑战,我们提出了 \textbf{战略性思维链} (SCoT),这是一种新颖的方法,旨在通过在生成中间推理步骤之前整合策略知识来提升 LLM 性能。SCoT 在单个提示内采用两阶段方法:首先引导出有效的问题解决策略,随后利用该策略指导生成高质量的 CoT 路径和最终答案。我们在八个具有挑战性的推理数据集上的实验表明了显著的改进,包括使用 Llama3-8b 模型在 GSM8K 数据集上提升 21.05%,在 Tracking\_Objects 数据集上提升 24.13%。此外,我们将 SCoT 框架扩展为一种具有自动匹配示例的 few-shot 方法,取得了更强的结果。这些发现强调了 SCoT 的有效性,突显了其在复杂推理任务中大幅提升 LLM 性能的潜力。
引用
@article{arxiv.2409.03271,
title = {Strategic Chain-of-Thought: Guiding Accurate Reasoning in LLMs through Strategy Elicitation},
author = {Yu Wang and Shiwan Zhao and Zhihu Wang and Heyuan Huang and Ming Fan and Yubo Zhang and Zhixing Wang and Haijun Wang and Ting Liu},
journal= {arXiv preprint arXiv:2409.03271},
year = {2024}
}