中文

别以外貌判断书:测试 LLM 在逻辑混淆下的鲁棒性

计算与语言 2026-02-03 v1

摘要

诸如解算数方程、求真值表、完成三段论等任务,大语言模型(LLM)在标准形式下表现良好,但在相同问题以逻辑等价且混淆的格式呈现时常常失败。为研究这一漏洞,我们引入 Logifus 一种结构保持的逻辑混淆框架,并基于此构建 LogiQAte—a 首个其类型诊断基准,包含 1,108 个问题,覆盖四类推理任务:(i) Obfus FOL(等价重写下的一阶逻辑蕴涵)、(ii) Obfus Blood Relation(间接关系链下的家族图谱蕴涵)、(iii) Obfus Number Series(符号替换下的模式归纳)、(iv) Obfus Direction Sense(改动方向与参照系下的导航推理)。在所有任务中,对六个最新模型进行评估,我们发现混淆严重降低了零样本性能,GPT-4o 平均下降 47%,GPT-5 平均下降 27%,而推理模型 o4-mini 平均下降 22%。我们的发现表明,当前 LLM 仅在表面形式上解析问题,缺乏深入理解,凸显构建真正理解并保持意义 beyond surface form 的模型的紧迫性。

关键词

引用

@article{arxiv.2602.01132,
  title  = {Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation},
  author = {Abhilekh Borah and Shubhra Ghosh and Kedar Joshi and Aditya Kumar Guru and Kripabandhu Ghosh},
  journal= {arXiv preprint arXiv:2602.01132},
  year   = {2026}
}

备注

19 pages, 6 figures