中文

用LAPITHS驯服半人马:一个基于理论的人工智能性能解释框架

人工智能 2026-05-01 v1

摘要

我们引入了一个名为LAPITHS(通过基于范式的人类相似性论点解释的语言模型分析)的框架,并用它来证明,像CENTAUR这样被提议为人工统一认知模型的模型所提出的几个主要主张,在理论上或经验上都没有得到证实。LAPITHS提供了一个原则性的参考点,以对抗当前人工智能研究中的行为主义倾向,即把基于Transformer的语言模型的人类水平性能解释为类人底层计算的证据,并进而解释为认知能力的标志。LAPITHS的新颖之处在于,它明确阐述了基于两个定量评估的论点:(i) 最小认知网格,一种用于估计人工系统认知合理性的理论驱动方法,以及 (ii) 一个行为比较,表明与CENTAUR类模型报告的结果相似的结果,可以由其他不满足通常与认知合理性相关的结构约束的系统复现,并且其输出不能为人类认知提供独立的解释性见解。

关键词

引用

@article{arxiv.2604.27927,
  title  = {Taming the Centaur(s) with LAPITHS: a framework for a theoretically grounded interpretation of AI performances},
  author = {Matteo Da Pelo and Alessio Donvito and Claudio Frongia and Pietro Salis and Antonio Lieto},
  journal= {arXiv preprint arXiv:2604.27927},
  year   = {2026}
}

备注

28 pages