中文

基于试错法评估智能性

人工智能 2025-03-06 v2 计算与语言 计算机视觉与模式识别 信息检索 机器学习

摘要

智能是物种在有限的试错尝试次数中找到解决方案的关键特性。基于这一思想,我们引入Survival Game作为一个框架,通过试错过程中失败次数来评估智能性。失败次数越少,表明智能性越高。当失败次数的期望值和方差均为有限值时,即表明系统能够一致地解决新挑战,我们定义为自主智能水平。使用Survival Game,我们全面评估了现有AI系统。结果表明,尽管AI系统在简单任务中实现了自主智能水平,但在视觉、搜索、推荐和语言等更复杂任务中仍远未达到。虽然规模化当前AI技术可能有助于提高,但其成本将是天文学的。预测表明,要实现通用任务的自主智能水平,需要102610^{26}个参数。为put this into perspective,加载如此庞大的模型需要如此多的H100 GPU,其总价值是Apple Inc.市值的10710^{7}倍。即便有Moore's Law,支持如此参数规模也需要70年。这一惊人成本凸显了人类任务的复杂性以及当前AI技术的不足之处。为进一步探讨此现象,我们对Survival Game进行了理论分析并进行了实验结果分析。我们的发现表明,人类任务具有关键性特性。因此,实现自主智能水平需要对任务底层机制的深入理解。当前AI系统并未完全把握这些机制,仅依赖浅层模仿,难以达到自主智能水平。我们认为Survival Game不仅可以指导AI的未来发展,也能为人类智能提供深刻的洞见。

关键词

引用

@article{arxiv.2502.18858,
  title  = {Evaluating Intelligence via Trial and Error},
  author = {Jingtao Zhan and Jiahao Zhao and Jiayu Li and Yiqun Liu and Bo Zhang and Qingyao Ai and Jiaxin Mao and Hongning Wang and Min Zhang and Shaoping Ma},
  journal= {arXiv preprint arXiv:2502.18858},
  year   = {2025}
}