数学与编码是通用的 AI 基准
人工智能
2025-12-17 v1 机器学习
摘要
我们研究了数学与编码在 AI 智能体心理测量测试模空间中的特殊作用。基于先前工作中的 AAI 框架和 GVU 动力学,我们定义了数学纤维,并证明当与形式证明内核(如 Lean、Coq)配对时,该纤维上的 GVU 流由于类似预言机的验证而允许谱稳定的自我改进机制。我们的主要技术结果是密度定理:在智能体输出一致紧致且 AAI 泛函满足 Lipschitz 条件的情况下,由数学定理证明和编码任务生成的测试子空间在评估度量下于测试模空间中稠密。在此意义上,仅编码是通用的,而纯数学则不然;其特权在于谱性而非表达性。我们将其解释为数学与编码为评估提供了“通用坐标”的证据,且形式数学是高级 AI 智能体递归自我改进的天然引发域。
引用
@article{arxiv.2512.13764,
title = {Mathematics and Coding are Universal AI Benchmarks},
author = {Przemyslaw Chojecki},
journal= {arXiv preprint arXiv:2512.13764},
year = {2025}
}