从 0 阶选择到 2 阶判断:组合化硬化暴露前沿大语言模型的组合化失效
计算与语言
2026-05-11 v1
摘要
多选推理基准面临双重挑战:随模型进步而快速饱和,以及数据污染导致静态评估失效。现有的硬化方法(改写、扰动)试图增加难度,但为牺牲逻辑有效性换取表面复杂度,难以挑战高级推理模型。我们提出 LogiHard,一个形式化框架,将 0 阶选择确定性地转化为 2 阶逻辑判断,显著增加思考负荷和推理步骤。该框架集成项目反应理论(IRT)进行计算机化自适应测试(CAT),实现基于问题难度的精确控制,所需问题数少于静态基准。我们实现 LogiHard-2k,通过对模型思维轨迹进行 9 维分析,对高风险考试题目进行认知排序,然后对高难度题目进行组合化转化。评估包括 12 个最先进模型,组合化硬化问题的准确率下降 31%~56%。大语言模型存在多选失败和提前退出偏差,这些问题人类考生不共享。零样本迁移到 MMLU 显示 47% 的准确率下降(从 89.84% 降至 42.86%),确认该方法在不同领域中保持可验证有效性。一致的聚合退化是领域无关的,源自组合化推理差距,而非知识缺口,这反映出训练导致的完备性-验证缺失。
引用
@article{arxiv.2605.07268,
title = {From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs},
author = {Hanmeng Liu and Shichao Weng and Xiulai Liu and Zhicai Zhang and Anli Yan and Xiaozhang Liu},
journal= {arXiv preprint arXiv:2605.07268},
year = {2026}
}