中文

NOVA:知识发现通过 AI 的基本限制

人工智能 2026-05-29 v2 信息论 math.IT

摘要

AI 系统能否通过迭代自我改进发现真实的新知识?若能,其代价为何?我们提出 NOVA 框架,将常见的“生成、验证、累积、再训练”循环建模为知识空间上的自适应抽样过程。我们识别 Accumulated genuine knowledge Eventually covers a finite domain 的充分条件,指出其违反会产生不同失效模式:污染、遗忘、探索失败、接受失败。随后我们分析不完美的验证,识别出一种污染陷阱:随着易发现的知识耗尽,分配给新有效 artifact 的模型质量缩小,即使微小的假阳性率也会导致无效 artifact 进入知识库的速度超过真实发现的速度。我们澄清说明 Good--Turing 估计是局部批次多样性诊断工具,而非历史上尚未发现的有效质量估计器,这决定了长期发现的支配因素。在另一假设下,将模型的有效发现分布与指数为 α>1\alpha>1 的齐bius分布等价, 我们证明获取 DD 个 distinct genuine discoveries 所需的累计生成成本满足 Rcum(D)=Θ(cgenDα)R_{\mathrm{cum}}(D)=\Theta(c_{\mathrm{gen}}D^\alpha),其中 cgenc_{\mathrm{gen}} 为每个候选生成成本。该比例定律量化了当发现前沿推进时渐近的边际报酬递减。最后,我们形式化地通过 guidance、generation、verification 实现 human amplification,解释专家输入为何在自主探索障碍附近最为有价值。

关键词

引用

@article{arxiv.2605.15219,
  title  = {NOVA: Fundamental Limits of Knowledge Discovery Through AI},
  author = {Salman Avestimehr and Ken Duffy and Muriel Médard},
  journal= {arXiv preprint arXiv:2605.15219},
  year   = {2026}
}