中文

Aletheia:通过正则化逆混淆矩阵量化推理模型中的认知信念

人工智能 2026-01-06 v1 计算与语言 机器学习

摘要

在通往人工通用智能(AGI)的进程中,当前评估范式面临一种认识论危机。静态基准衡量知识广度,却未能量化信念的深度。虽然Simhi等人(2025)在标准问答中定义了CHOKE现象,但我们将该框架扩展到量化System 2推理模型中的"认知信念"。我们提出Aletheia计划,一种认知物理框架,采用Tikhonov正则化来逆转评判者混淆矩阵。为在不依赖不透明私人数据的前提下验证此方法,我们实现了一个合成代理协议。我们的初步试验研究表明,尽管推理模型表现为"认知缓冲器”,但在对抗压力下可能表现出"防御性过度思考”。此外,我们引入对齐信念得分(S_aligned)以验证信念是否妥协安全。本工作为衡量AI科学完整性提供了蓝图。

关键词

引用

@article{arxiv.2601.01532,
  title  = {Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix},
  author = {Fanzhe Fu},
  journal= {arXiv preprint arXiv:2601.01532},
  year   = {2026}
}

备注

6 pages, 2 figures