中文

ChatGPT推理能力的评测

人工智能 2023-10-11 v1

摘要

我将量化ChatGPT在推理任务中产生的逻辑错误。实验中,我使用了来自库 \url{https://users.utcluj.ro/~agroza/puzzles/maloga}~\cite{groza:fol} 的144道谜题。该库包含多种类型的谜题,包括算术谜题、逻辑方程、类数独谜题、类斑马谜题、说真话谜题、网格谜题、奇异数字或自指谜题。这些谜题的正确解基于等式一阶逻辑中的人工建模,使用定理证明器Prover9~\cite{mccune2005release}与有限模型寻找器Mace4~\cite{mccune2003mace4}进行了校验。本研究的第一个产出是100道逻辑谜题的基准数据集。对于该数据集,ChatGPT仅对7%提供了正确答案与论证。由于该数据集颇具挑战性,诚邀研究者们在更先进或经调优的模型(如ChatGPT3.5以外的模型)及更精心设计的提示词上测试该数据集。第二个产出是对ChatGPT所传达推理错误的分类。该分类构成了大语言模型生成推理错误分类法的基础。我已识别出67类此类逻辑错误,其中包括:不一致、蕴含不成立、无支撑断言、缺乏常识、错误论证。ChatGPT生成的100个解包含698个逻辑错误,即平均每个推理任务有7个谬误。第三个产出是带有相应逻辑错误标注的ChatGPT作答。对ChatGPT答案中每个错误陈述均进行了人工标注,旨在量化该语言模型生成的错误文本量。平均而言,所生成文本的26.03%为逻辑错误。

关键词

引用

@article{arxiv.2310.05993,
  title  = {Measuring reasoning capabilities of ChatGPT},
  author = {Adrian Groza},
  journal= {arXiv preprint arXiv:2310.05993},
  year   = {2023}
}