LogicAsker:评估与提升大型语言模型的逻辑推理能力
软件工程
2024-10-10 v3 人工智能
计算与语言
计算机科学中的逻辑
摘要
我们介绍了 LogicAsker,一种用于评估和增强大型语言模型(如 ChatGPT 和 GPT-4)逻辑推理能力的新方法。尽管 LLM 在写作辅助、代码生成和机器翻译等任务中表现出色,但评估其推理能力一直具有挑战性。传统评估通常优先考虑在下游任务上的准确性,而非直接评估推理过程。LogicAsker 通过采用一套基于命题逻辑和谓词逻辑的原子推理技能来系统地检验和提升 LLM 的推理能力,从而填补了这一空白。我们的方法揭示了 LLM 在逻辑规则学习方面存在显著差距,在不同模型中发现的推理失败率从 29% 到 90% 不等。此外,我们利用这些发现构建了针对性的示例和微调数据,使 GPT-4o 等模型的逻辑推理能力最高提升了 5%。据我们所知,这是首次利用测试用例结果来有效改进 LLM 形式推理能力的工作。我们公开了我们的代码、数据和结果 (https://github.com/yxwan123/LogicAsker),以促进进一步的研究和复现我们的发现。
引用
@article{arxiv.2401.00757,
title = {LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models},
author = {Yuxuan Wan and Wenxuan Wang and Yiliu Yang and Youliang Yuan and Jen-tse Huang and Pinjia He and Wenxiang Jiao and Michael R. Lyu},
journal= {arXiv preprint arXiv:2401.00757},
year = {2024}
}
备注
Accepted by EMNLP 2024