中文

CogniLoad:一个可调节长度、内在难度与干扰密度的合成自然语言推理基准

计算与语言 2025-09-26 v2 人工智能 机器学习

摘要

当前的大范围上下文推理基准常常混合了关键因素,如内在任务复杂度、干扰干扰和任务长度。为实现更精确的错误分析,我们引入 CogniLoad,一个新型合成基准,基于认知负荷理论 (CLT)。CogniLoad 生成具有可独立调节参数的自然语言逻辑谜题,这些参数反映 CLT 的核心维度:内在难度 (dd) 控制内在负荷;干扰比信号比 (ρ\rho) 调节外在负荷;任务长度 (NN) 作为要求 germane 负荷条件的操作性代理。我们对 22 项 SotA 推理 LLM 进行评估,CogniLoad 揭示了不同的性能灵敏性,识别出任务长度是主要约束,并发现了对内在复杂度的不同容忍度以及对干扰比率的 U 型响应。通过对这些认知负荷维度提供系统、纤细的控制,CogniLoad 为解构 LLM 推理局限性并指导未来模型开发提供了可复现、可扩展且诊断丰富的工具。

关键词

引用

@article{arxiv.2509.18458,
  title  = {CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density},
  author = {Daniel Kaiser and Arnoldo Frigessi and Ali Ramezani-Kebrya and Benjamin Ricaud},
  journal= {arXiv preprint arXiv:2509.18458},
  year   = {2025}
}

备注

29 pages (main: 12 + supplemental material: 17), 6 figures, 4 tables, Code: https://github.com/kaiserdan/cogniload, Data: https://huggingface.co/datasets/cogniloadteam/cogniload