中文

确定性-有效性:离散承诺系统的诊断框架

机器学习 2026-03-03 v1 计算机视觉与模式识别

摘要

标准机器学习评估指标——准确率、精确率、召回率和AUROC——假设所有错误在价值上是等价的:一个自信的错误预测与不确定的预测被等同惩罚。对于离散承诺系统(即选择确定状态{-W, 0, +W}的架构)而言,这一假设是认识论学上有缺陷的。在本文中,我们引入确定性-有效性(Certainty-Validity, CVS)框架,作为一种诊断方法,将模型性能分解为2x2矩阵,以区分高置信度/有效预测与低置信度/无效预测。该框架揭示了标准准确率隐藏的关键失效模式:自信错误(Confident-Incorrect, CI)行为,即模型在模糊数据中拟造结构。通过在Fashion-MNIST、EMNIST和IMDB上的消融实验,我们分析了“83%歧义天花板”——该特定离散架构在噪声基准上始终停滞的临界点。与连续模型不同后者可通过记忆纹理或统计噪声超越此天花板,离散模型拒绝对模糊样本作出承诺。我们表明,这种拒绝并非失误而是特性:模型在结构证据终止处停止。然而,标准在模糊数据上的训练最终导致良性过拟合,引起从不确定错误(适当的怀疑)向自信错误(幻觉)的病理性迁移。我们提出,对于推理系统而言,“良好训练”不应以准确率为标准,而应以最大化确定性-有效性得分(CVS)为目标——确保模型在该处停止。

关键词

引用

@article{arxiv.2603.00070,
  title  = {Certainty-Validity: A Diagnostic Framework for Discrete Commitment Systems},
  author = {Datorien L. Anderson},
  journal= {arXiv preprint arXiv:2603.00070},
  year   = {2026}
}

备注

18 pages, 1 figure, full experiment data can be found: https://zenodo.org/records/18530003