推理可能损害大语言模型的归纳能力
计算机视觉与模式识别
2025-06-02 v1 人工智能
计算与语言
摘要
大语言模型 (LLMs) 在各个领域都展现出了显著的进步,但它们执行归纳推理——从稀疏示例中推断潜在规则——的能力仍然有限。通常假设,大型推理模型 (LRMs) 中使用的思维链 (CoT) 提示可以增强此类推理。我们通过创建四个受控的、基于诊断的游戏任务——国际象棋、德州扑克、掷骰子游戏和二十一点——来研究这一假设,这些任务带有隐藏的人为定义规则。我们发现 CoT 推理会降低归纳性能,LRMs 的表现通常不如其非推理对应模型。为了解释这一点,我们提出了一个理论框架,揭示了推理步骤如何通过三种失败模式放大错误:子任务分解不正确、子任务求解不正确以及最终答案总结不正确。基于我们的理论和实证分析,我们引入了结构化干预措施,根据我们识别出的失败类型调整 CoT 生成。这些干预措施无需重新训练即可提高归纳准确性。我们的研究结果表明,有效的 (CoT) 推理不仅取决于采取更多步骤,还取决于确保这些步骤结构良好。
引用
@article{arxiv.2505.24225,
title = {Reasoning Can Hurt the Inductive Abilities of Large Language Models},
author = {Haibo Jin and Peiyan Zhang and Man Luo and Haohan Wang},
journal= {arXiv preprint arXiv:2505.24225},
year = {2025}
}
备注
26 pages