将预测服务评估为主动属性组合上的准确率曲面
机器学习
2021-10-27 v2
摘要
我们的目标是对黑盒分类模型的准确率进行评估,不是作为给定测试数据分布上的单一聚合值,而是作为刻画多个测试数据分布的大量属性组合之上的一个曲面。随着机器学习模型作为服务被部署,此类属性化准确率度量变得重要起来:训练数据分布对客户端隐藏,且不同客户端可能关注数据分布的不同区域。我们提出 Attributed Accuracy Assay (AAA)——一种基于高斯过程(GP)的针对此类准确率曲面的概率估计器。每个称为“臂”的属性组合都与一个 Beta 密度相关联,服务的准确率从该密度中采样。我们期望 GP 在相关臂上平滑 Beta 密度的参数以缓解稀疏性。我们表明,直接应用 GP 无法应对巨大属性空间上稀疏且不均匀分布的异方差不确定性挑战。对此,我们提出两种改进:汇聚稀疏观测,以及正则化 Beta 密度的尺度参数。在引入这些创新后,我们通过大量实验和分析确立了 AAA 在估计准确率和探索效率两方面的有效性。
引用
@article{arxiv.2108.06514,
title = {Active Assessment of Prediction Services as Accuracy Surface Over Attribute Combinations},
author = {Vihari Piratla and Soumen Chakrabarty and Sunita Sarawagi},
journal= {arXiv preprint arXiv:2108.06514},
year = {2021}
}
备注
NeurIPS 2021; Code and dataset at: https://github.com/vihari/AAA; 19 pages