中文

干预复杂度作为标准奖励与智能的度量

人工智能 2026-05-12 v2

摘要

Legg-Hutter 普遍智能度量提供了对一般智能的严格标量评估,将所有可计算环境下的预期奖励加权求和,权重由简单性决定。然而,该度量预设了外部指定的奖励函数,引出一个问题:奖励原语本质上是任意的,还是存在标准选择?我们提出一种新度量——干扰复杂度 (intervention complexity),其具有五种自然属性:环境导因性、普遍性、最小性、灵敏性与成就偏好。给定资源函数 rho 编码一种归纳偏好(如程序长度、执行时间或能耗),rho-干扰复杂度是一种普遍奖励。结果产生一族由资源偏好索引的标准奖励,为 Legg-Hutter 框架提供原则性完善,无需外部规范性输入。我们进一步提出一种二维智能特征描述:代理人能力(相对于 oracle 最优的表现)与学习效率(能力随经验提升的速度)。分离定理表明,资源偏好的选择决定该度量的可计算性:动作计数 IC 可在多项式时间内可计算,而无 oracle 访问的程序长度 IC 是不可计算的,oracle 与裸 IC 之间的差距恰好量化了学习的信息论内容。我们讨论了对超级智能以及预训练通用代理的意义。

关键词

引用

@article{arxiv.2605.02175,
  title  = {Intervention Complexity as a Canonical Reward and a Measure of Intelligence},
  author = {Brendan McCane},
  journal= {arXiv preprint arXiv:2605.02175},
  year   = {2026}
}

备注

23 pages