要求超越贝叶斯最优:分类中的不决策理论
统计理论
2025-10-28 v3 机器学习
统计方法学
机器学习
统计理论
摘要
选择性分类是高风险场景中自动化决策的强大工具,允许分类器仅在置信时行动,在不确定性高时弃权。给定目标准确率,我们的目标是最小化不决策量,即我们未自动化的观测值。对于困难问题,若不弃权则可能无法达到目标准确率。通过使用不决策,我们可以将误分类率控制在任何用户指定的水平,甚至低于贝叶斯最优错误率,同时最小化总体不决策量。我们给出了选择性分类中极小化风险的一个完整刻画,建立了连续性和单调性性质,从而能够实现最优不决策选择。我们通过奈曼-皮尔逊检验框架重新审视选择性推断,其中不决策允许在给定第一类错误概率下控制第二类错误。对于分类和检验,我们提出了一种具有非渐近保证的有限样本校准方法,证明了插件分类器保持一致性,且基于准确率的校准能有效控制不决策量。在二元高斯混合模型中,我们发现了选择性推断中的第一个尖锐相变,表明即使在类别分离较差的情况下,最小不决策也能产生接近最优的准确率。在高斯混合和真实数据集上的实验证实,较小的不决策比例能带来显著的准确率提升,使不决策成为风险控制的一个原则性工具。
引用
@article{arxiv.2412.12807,
title = {Ask for More Than Bayes Optimal: A Theory of Indecisions for Classification},
author = {Mohamed Ndaoud and Peter Radchenko and Bradley Rava},
journal= {arXiv preprint arXiv:2412.12807},
year = {2025}
}