General365:面向大语言模型通用推理的基准测试
计算与语言
2026-04-14 v1 人工智能
摘要
当今的大型语言模型 (LLM) 在数学和物理等专业领域展现出惊人的推理能力,但其将这些推理技能推广到更通用和更广泛情境中的能力——即通用推理——仍鲜有探索。不同于专业领域的推理,通用推理更依赖于一般性知识,却仍面临复杂约束、嵌套逻辑分支和语义干扰等巨大挑战。为填补这一空白,我们引入 General365,一个专为评估 LLM 通用推理而设计的基准测试。通过限制背景知识为小学至中学水平 (K-12),General365 显式地将推理与专业专长分离。该基准测试包含 365 个种子问题和 1,095 个变体问题,覆盖八个类别,确保高难度和多样性。26 所领先 LLM 的评估显示,尽管表现最好的模型仅达到 62.8% 的准确率,与 LLM 在数学和物理基准测试中接近完美的表现形成鲜明对比。这些结果表明,当前 LLM 的推理能力高度依赖于具体领域,在更广泛的实际应用中仍有显著提升空间。我们期望 General365 成为推动 LLM 推理超越领域特定任务,迈向稳健通用实用场景的催化剂。代码、数据集和排行榜:https://general365.github.io
引用
@article{arxiv.2604.11778,
title = {General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks},
author = {Junlin Liu and Shengnan An and Shuang Zhou and Dan Ma and Shixiong Luo and Ying Xie and Yuan Zhang and Wenling Yuan and Yifan Zhou and Xiaoyu Li and Ziwen Wang and Xuezhi Cao and Xunliang Cai},
journal= {arXiv preprint arXiv:2604.11778},
year = {2026}
}
备注
17 pages, 9 figures