ChaosBench-Logic v2:评估具有动态系统特征的大语言模型逻辑推理能力
机器学习
2026-05-26 v1 人工智能
摘要
标准准确率掩盖了关键失效模式:先验崩溃、在改写情况下的不一致性,以及无法推理参数依赖的动态系统。我们提出ChaosBench-Logic v2,一个覆盖165个动态系统、包含27个一阶逻辑谓词和78条公理边的、由40,886个问题构成的基准测试,同时引入CARE(校准-鲁棒评估)协议,以揭示这些病灶。评估了14个模型后发现,尽管前沿模型在情节转换推理方面仍接近随机(MCC=0.05),但在给定前提下的一阶逻辑演绎达到MCC=0.52。按模型族 decomposition 显示,专有模型优势集中在跨指标(+0.40)和一致性任务上,而开源Qwen 2.5-32B在指标诊断上占据优势(0.91 vs. 0.45)。有两个模型在分叉问题上表现出负MCC,通过混淆矩阵分析确认为系统性反相关。
引用
@article{arxiv.2605.24305,
title = {ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale},
author = {Noel Thomas},
journal= {arXiv preprint arXiv:2605.24305},
year = {2026}
}
备注
14 pages, 8 figures. Published at the ICLR 2026 Workshop on LLM Reasoning