通过提示工程与模型对答案的解释理解 LLM 的科学推理
人工智能
2025-07-28 v2
摘要
大语言模型(LLMs)在跨领域的自然语言理解、推理和问题解决方面展现了卓越的能力。然而,它们执行复杂的、多步骤推理任务的能力——这对于科学、医学和法律领域的应用至关重要——仍然是一个活跃的研究领域。本文考察了当代 LLM 的推理能力,分析了它们的优势、局限性和改进潜力。该研究在研究生级别的 GoogleProof Q&A (GPQA) 数据集上使用提示工程技术来评估 GPT-4o 的科学推理能力。测试了五种流行的提示工程技术和两种定制提示:基线直接回答(零样本)、思维链(CoT)、零样本 CoT、自我提问、自洽性、分解和多路径提示。我们的发现表明,虽然 LLM 表现出涌现的推理能力,但它们通常依赖模式识别而非真正的逻辑推理,导致在复杂问题解决中出现不一致。结果表明,自洽性以 52.99% 的准确率优于其他提示工程技术,其次是直接回答(52.23%)。零样本 CoT(50%)优于多路径(48.44%)、分解(47.77%)、自我提问(46.88%)和 CoT(43.75%)。自洽性在解释答案方面表现第二差。直接回答、CoT 和零样本 CoT 等简单技术具有最佳的科学推理能力。我们提出了一个旨在通过整合结构化推理框架、混合 AI 方法和人在回路方法论来弥合这些差距的研究议程。通过批判性地评估 LLM 的推理机制,本文为关于通用人工智能的未来以及开发更鲁棒、更值得信赖的 AI 系统的持续讨论做出了贡献。
引用
@article{arxiv.2505.01482,
title = {Understanding LLM Scientific Reasoning through Promptings and Model's Explanation on the Answers},
author = {Alice Rueda and Mohammed S. Hassan and Argyrios Perivolaris and Bazen G. Teferra and Reza Samavi and Sirisha Rambhatla and Yuqi Wu and Yanbo Zhang and Bo Cao and Divya Sharma and Sridhar Krishnan and Venkat Bhat},
journal= {arXiv preprint arXiv:2505.01482},
year = {2025}
}