观测多重性
机器学习
2025-08-01 v1
摘要
许多预测任务可以容纳多个表现几乎同样出色的模型。当竞争模型对个体给出相互冲突的预测时,这种现象可能会破坏可解释性和安全性。在本研究中,我们探讨在概率分类任务中,由于一种我们称之为“观测多重性”的效应,任意性是如何产生的。我们讨论了这种效应如何在一大类实际应用中出现,在这些应用中,我们学习一个分类器来预测概率 ,但获得的数据集是观测值 。我们提出通过“遗憾”的视角来评估个体概率预测的任意性。我们引入了一种针对概率分类任务的遗憾度量,用于衡量模型的预测如何因训练标签的改变而发生变化。我们提出了一种通用方法来估计概率分类任务中的遗憾。我们利用该度量展示了数据集中某些群体的遗憾更高,并讨论了遗憾的潜在应用。我们展示了如何通过弃权和数据收集来估计遗憾,从而提升真实世界应用中的安全性。
引用
@article{arxiv.2507.23136,
title = {Observational Multiplicity},
author = {Erin George and Deanna Needell and Berk Ustun},
journal= {arXiv preprint arXiv:2507.23136},
year = {2025}
}