中文

蒸汽滚筒问题:基于自动定理证明策略评估 LLM 推理能力

计算与语言 2024-07-31 v1 人工智能

摘要

本研究首次检视大语言模型(LLM)遵循自动定理证明器(ATP)所采用的推理策略的能力。我们评估了GPT4、GPT3.5 Turbo和Google最新Gemini模型在蒸汽滚筒领域问题上的表现。除确定准确率外,我们利用自然语言处理库spaCy探索新的方法来探讨LLM推理能力。这一发现引发警惕的是:正确推理与正确答案之间的相关性极低,适用于所测试的任何模型。我们发现,采用ATP推理策略时的模型表现相当于一次性链式思考,且对准确结果中不确定性的关注对于得出关于模型表现的结论至关重要。与之前的假设一致,我们确认LLM偏好底向上推理过程且最擅长遵循此类推理。然而,推理策略仍可用于从trusted推理引擎外部处理中派生出小且相关的公式集合。

关键词

引用

@article{arxiv.2407.20244,
  title  = {Steamroller Problems: An Evaluation of LLM Reasoning Capability with Automated Theorem Prover Strategies},
  author = {Lachlan McGinness and Peter Baumgartner},
  journal= {arXiv preprint arXiv:2407.20244},
  year   = {2024}
}