LogiPlan:面向LLM的逻辑规划与关系推理的结构化基准
人工智能
2025-06-13 v1 性能
摘要
我们提出了LogiPlan,一个用于评估大语言模型(Large Language Models, LLMs)在复杂关系结构上进行逻辑规划和推理能力的新型基准。逻辑关系推理对于依赖LLM生成和查询关系结构图的应用至关重要,例如网络基础设施、知识库或业务流程模式。我们的框架通过控制对象数量、关系数量以及关系链的最小深度来动态变化任务复杂度,从而在不同难度级别上对模型性能进行细粒度评估。LogiPlan涵盖三个互补任务:(1)计划生成,模型必须构建满足指定结构约束的有效有向关系图;(2)一致性检测,测试模型识别关系结构中不一致性的能力;以及(3)比较问答,评估模型在给定图中判断查询关系有效性的能力。此外,我们通过提示模型验证和完善其初始方案来评估模型的自纠错能力。我们在包括DeepSeek R1、Gemini 2.0 Pro、Gemini 2 Flash Thinking、GPT-4.5、GPT-4o、Llama 3.1 405B、O3-mini、O1和Claude 3.7 Sonnet在内的最先进模型上进行了评估,揭示了与模型规模和架构相关的显著性能差距。我们的分析表明,尽管近期的推理增强模型在简单实例上展现出有前景的结果,但它们在需要更深层逻辑规划的复杂配置中仍然存在困难。
引用
@article{arxiv.2506.10527,
title = {LogiPlan: A Structured Benchmark for Logical Planning and Relational Reasoning in LLMs},
author = {Yanan Cai and Ahmed Salem and Besmira Nushi and Mark Russinovich},
journal= {arXiv preprint arXiv:2506.10527},
year = {2025}
}