中文

观测多重性

机器学习 2025-08-01 v1

摘要

许多预测任务可以容纳多个表现几乎同样出色的模型。当竞争模型对个体给出相互冲突的预测时,这种现象可能会破坏可解释性和安全性。在本研究中,我们探讨在概率分类任务中,由于一种我们称之为“观测多重性”的效应,任意性是如何产生的。我们讨论了这种效应如何在一大类实际应用中出现,在这些应用中,我们学习一个分类器来预测概率 pi[0,1]p_i \in [0,1],但获得的数据集是观测值 yi{0,1}y_i \in \{0,1\}。我们提出通过“遗憾”的视角来评估个体概率预测的任意性。我们引入了一种针对概率分类任务的遗憾度量,用于衡量模型的预测如何因训练标签的改变而发生变化。我们提出了一种通用方法来估计概率分类任务中的遗憾。我们利用该度量展示了数据集中某些群体的遗憾更高,并讨论了遗憾的潜在应用。我们展示了如何通过弃权和数据收集来估计遗憾,从而提升真实世界应用中的安全性。

关键词

引用

@article{arxiv.2507.23136,
  title  = {Observational Multiplicity},
  author = {Erin George and Deanna Needell and Berk Ustun},
  journal= {arXiv preprint arXiv:2507.23136},
  year   = {2025}
}