Resprompt:残差连接提示提升大语言模型的多步推理能力
计算与语言
2024-05-09 v2
摘要
思维链(CoT)提示通过提供逐步的问题解决原理,令人印象深刻地释放了大语言模型(LLM)的推理潜力。然而,标准 CoT 在需要多步推理的问题上效果较差。这一局限源于多步问题中复杂的推理过程:后续阶段常依赖于早前若干步骤的结果,而非仅紧邻前一步的结果。此类复杂性表明推理过程天然以图表示。而 CoT 提示近乎线性且直接的结构难以捕捉这一复杂推理图。为应对此挑战,我们提出残差连接提示(RESPROMPT),一种提升 LLM 多步推理的新提示策略。我们的核心思想是在提示中重构推理图。我们通过将推理图中存在但线性 CoT 流中缺失的必要连接—链接整合进提示来实现这一点。这些被称为“残差连接”的链接,在将线性 CoT 结构变形为图表示、有效捕捉多步问题固有的复杂推理图方面起关键作用。我们在跨越数学、序列与常识推理三个不同领域的六个基准上评估 RESPROMPT。对于开源的 LLaMA 系列模型,RESPROMPT 在 LLaMA-65B 上取得平均推理准确率显著提升 12.5%,在 LLaMA2-70B 上提升 6.8%。细分分析进一步凸显 RESPROMPT 在复杂多步推理上尤为出色:对于至少需五步推理的问题,RESPROMPT 以 LLaMA-65B 上平均 21.1% 和 LLaMA2-70B 上 14.3% 的显著平均提升优于最佳基于 CoT 的基准。通过大量消融研究和分析,我们明确了如何最有效地构建残差连接。
引用
@article{arxiv.2310.04743,
title = {Resprompt: Residual Connection Prompting Advances Multi-Step Reasoning in Large Language Models},
author = {Song Jiang and Zahra Shakeri and Aaron Chan and Maziar Sanjabi and Hamed Firooz and Yinglong Xia and Bugra Akyildiz and Yizhou Sun and Jinchao Li and Qifan Wang and Asli Celikyilmaz},
journal= {arXiv preprint arXiv:2310.04743},
year = {2024}
}
备注
29 pages