评估 ChatGPT 与 GPT-4 的逻辑推理能力
计算与语言
2023-05-08 v3 人工智能
摘要
掌握逻辑推理能力是一项综合性的自然语言理解任务。随着被强调在推理任务中具有“高级”能力的生成式预训练 Transformer 4(GPT-4)的发布,我们渴望了解 GPT-4 在各种逻辑推理任务上的表现。本报告分析了多个逻辑推理数据集,包括 LogiQA 和 ReClor 等流行基准,以及 AR-LSAT 等新发布的数据集。我们在需要逻辑推理的基准上测试了多项选择阅读理解和自然语言推理任务。我们进一步构建了一个逻辑推理分布外数据集,以研究 ChatGPT 和 GPT-4 的鲁棒性。我们还对 ChatGPT 和 GPT-4 进行了性能比较。实验结果表明,在大多数逻辑推理基准上,ChatGPT 的表现显著优于 RoBERTa 微调方法。凭借 GPT-4 API 的早期访问权限,我们能够对 GPT-4 模型进行密集实验。结果显示,GPT-4 在大多数逻辑推理数据集上取得了更高的性能。在各基准中,ChatGPT 和 GPT-4 在 LogiQA 和 ReClor 等知名数据集上表现相对较好。然而,在处理新发布和分布外数据集时,性能显著下降。逻辑推理对 ChatGPT 和 GPT-4 仍然具有挑战性,特别是在分布外和自然语言推理数据集上。我们发布了提示风格的逻辑推理数据集作为基准套件,并将其命名为 LogiEval。
引用
@article{arxiv.2304.03439,
title = {Evaluating the Logical Reasoning Ability of ChatGPT and GPT-4},
author = {Hanmeng Liu and Ruoxi Ning and Zhiyang Teng and Jian Liu and Qiji Zhou and Yue Zhang},
journal= {arXiv preprint arXiv:2304.03439},
year = {2023}
}