中文

基准的几何学:通往人工通用智能的新路径

人工智能 2025-12-05 v1 机器学习 统计理论 统计理论

摘要

基准是人工智能(AI)进展评估的主要工具,但当前实践在孤立的测试套组上评估模型,为推理关于普遍性或自主自我改进提供有限指导。本文引入了一个几何框架,将所有心理测量电池视为结构化模数空间中的点,描述代理人性能的能力函数。首先,我们定义了自主AI(AAI)尺度,这是一种以可衡量的性能为基础的自治等级制度,涵盖推理、规划、工具使用和长期控制等任务家族。其次,我们构建了基准的模数空间,识别在代理人排序和能力推断水平上不可区分的基准等价类。这种几何结构产生确定性结果:密集的基准族足以认证在整个任务空间上的性能。此外,我们引入一种通用的生成-验证-更新(GVU)算子,将强化学习、自我对弈、辩论和验证器基于微调等作为特殊情况。我们定义自我改进系数κ\kappa为能力函数在诱导流动方向上的李导数。对生成和验证噪声的组合方差不等式提供了κ>0\kappa > 0的充分条件。我们的结果表明,人工通用智能(AGI)的进展最好被理解为基准模数的流动,由GVU动力学驱动,而非单个排行榜上的分数。

关键词

引用

@article{arxiv.2512.04276,
  title  = {The Geometry of Benchmarks: A New Path Toward AGI},
  author = {Przemyslaw Chojecki},
  journal= {arXiv preprint arXiv:2512.04276},
  year   = {2025}
}