中文

ChaosBench-Logic:面向混沌动力系统的逻辑与符号推理基准

人工智能 2026-02-13 v1 信息论 math.IT

摘要

大型语言模型 (LLM) 在自然语言任务中表现出色,但在需要精确逻辑和符号推理的领域仍显脆弱。混沌动力系统尤其具有挑战性,因为混沌是确定性的,却常被误解为随机或复杂。我们引入 ChaosBench-Logic,一个评估 LLM 在30个不同动力系统上的推理的基准测试。该基准使用统一的一阶逻辑 (FOL) 词典进行注释。每个系统都为 11 个语义谓词分配真值,生成621个问题,涵盖包括多跳推论、跨系统类比、反事实推理、偏见探测和多轮对话等七个推理类别。我们定义了逻辑准确性、蕴含一致性、对话连贯性和矛盾度的指标,并发布了开源评估管道。初始实验表明,前沿 LLM 如 GPT-4、Claude 3.5 Sonnet、Gemini 2.5 Flash 和开源 LLaMA-3 70B 在单项准确率上达到91%-94%,但在组合项目上仍为0%,且在全局连贯性方面表现脆弱。对话水平准确率范围从 GPT-4 CoT 的53.1% 到 LLaMA-3 zero-shot 的75.5%。ChaosBench-Logic 为诊断此类失效和发展改进 LLM 科学推理的神经符号方法提供了严格测试平台。

关键词

引用

@article{arxiv.2601.01982,
  title  = {ChaosBench-Logic: A Benchmark for Logical and Symbolic Reasoning on Chaotic Dynamical Systems},
  author = {Noel Thomas},
  journal= {arXiv preprint arXiv:2601.01982},
  year   = {2026}
}

备注

7 pages, 0 figures , Accepted to AAAI-26 Bridge Program: Logical and Symbolic Reasoning in Language Models (camera-ready)