中文

论证基于二元监督学习置信度校准的不可行性:信息论不可能性定理

机器学习 2025-09-19 v1

摘要

我们证明了一个根本性的不可行性定理:神经网络无法在使用二元正确/错误监督的情况下同时学习良好校准的置信度估计。通过严格的数学分析和全面实证评估(包括负奖励训练、对称损失函数和后处理校准方法),我们证明这是一种信息论约束,而非方法论失败。我们的实验揭示了普遍的失败模式:负奖励导致极端低置信度(ECE大于0.8),同时破坏置信度多样性(std小于0.05),对称损失无法摆脱二元信号平均化,后处理方法仅通过压缩置信度分布来实现校准(ECE小于0.02)。我们将其形式化为一个欠指定的映射问题,二元信号无法区分正确预测中不同置信度水平:一个60%置信的正确答案与一个90%置信的正确答案接收相同的监督。关键的是,我们的真实世界验证显示,在MNIST、Fashion-MNIST和CIFAR-10上,所有训练方法都以100%的失败率,而后处理校准的33%成功率则恰恰证实了我们的定理:通过转换而非学习来实现校准。这种不可行性直接解释了神经网络的幻觉,确立了为何后处理校准是数学上必需的,而不仅仅是方便的。我们提出了新的监督范式,包括集成 disagreement 和自适应多智能体学习,可在不要求人类置信度注释的情况下克服这些根本限制。

关键词

引用

@article{arxiv.2509.14386,
  title  = {Disproving the Feasibility of Learned Confidence Calibration Under Binary Supervision: An Information-Theoretic Impossibility},
  author = {Arjun S. Nair and Kristina P. Sinaga},
  journal= {arXiv preprint arXiv:2509.14386},
  year   = {2025}
}

备注

30 pages, 13 figures, 8 tables