中文

AUC 的知识如何约束可能的真值标签集合?

机器学习 2017-09-12 v2

摘要

近期关于隐私保护机器学习的研究探讨了如何可能(无论有意或无意)通过来自预言机(oracle)报告分类器在测试集上准确率的信息,对诸如 Kaggle 之类的数据挖掘竞赛进行“黑客”攻击。特别是对于二分类任务,最常见的准确率度量之一是 ROC 曲线下面积(AUC),本文探讨了 AUC 如何由相对于真值标签的 n 维实值“猜测”向量计算而来的数学结构。我们展示了关于分类器在测试集上 AUC 的知识如何约束可能的真值标签集合,并推导出一种算法,既能计算此类标签的精确数量,又能高效地枚举它们。最后,我们提供了经验证据:令人惊讶的是,兼容标签的数量实际上会随着 n 的增长而减少,直到达到一个依赖于测试集的阈值。

关键词

引用

@article{arxiv.1709.02418,
  title  = {How Does Knowledge of the AUC Constrain the Set of Possible Ground-truth Labelings?},
  author = {Jacob Whitehill},
  journal= {arXiv preprint arXiv:1709.02418},
  year   = {2017}
}