Aletheia:通过正则化逆混淆矩阵量化推理模型中的认知信念
人工智能
2026-01-06 v1 计算与语言
机器学习
摘要
在通往人工通用智能(AGI)的进程中,当前评估范式面临一种认识论危机。静态基准衡量知识广度,却未能量化信念的深度。虽然Simhi等人(2025)在标准问答中定义了CHOKE现象,但我们将该框架扩展到量化System 2推理模型中的"认知信念"。我们提出Aletheia计划,一种认知物理框架,采用Tikhonov正则化来逆转评判者混淆矩阵。为在不依赖不透明私人数据的前提下验证此方法,我们实现了一个合成代理协议。我们的初步试验研究表明,尽管推理模型表现为"认知缓冲器”,但在对抗压力下可能表现出"防御性过度思考”。此外,我们引入对齐信念得分(S_aligned)以验证信念是否妥协安全。本工作为衡量AI科学完整性提供了蓝图。
引用
@article{arxiv.2601.01532,
title = {Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix},
author = {Fanzhe Fu},
journal= {arXiv preprint arXiv:2601.01532},
year = {2026}
}
备注
6 pages, 2 figures