中文

模型变了吗?高效评估机器学习 API 的偏移

机器学习 2021-07-30 v1 人工智能 机器学习 应用统计

摘要

机器学习(ML)预测 API 的使用日益广泛。由于模型更新或重新训练,ML API 可能随时间发生变化。这给 API 的使用带来了一个关键挑战,因为用户通常不清楚 ML 模型是否以及发生了何种变化。模型偏移会影响下游应用性能,并引发监管问题(例如当需要一致性时)。在本文中,我们启动了对 ML API 偏移的系统性研究。我们首先量化了 2020 年至 2021 年间 Google、Microsoft、Amazon 等公司的流行 ML API 在多个数据集上的性能偏移。在我们调查的 36 个案例中,有 12 个发现了显著的模型偏移。有趣的是,我们发现若干数据集上 API 的预测随时间显著变差。这促使我们将 API 偏移评估问题在更细粒度上表述为:在数据分布恒定的情况下,估计 API 模型的混淆矩阵如何随时间变化。使用标准随机采样监控混淆矩阵偏移可能需要大量样本,这代价高昂,因为每次 API 调用都需要付费。我们提出了一种有原则的自适应采样算法 MASA,以高效估计混淆矩阵偏移。与随机采样相比,MASA 可使用最多减少 90% 的样本准确估计商业 ML API 中的混淆矩阵偏移。本工作确立了 ML API 偏移作为一个重要研究问题,并提供了一种经济高效的方法来监控此类偏移。

关键词

引用

@article{arxiv.2107.14203,
  title  = {Did the Model Change? Efficiently Assessing Machine Learning API Shifts},
  author = {Lingjiao Chen and Tracy Cai and Matei Zaharia and James Zou},
  journal= {arXiv preprint arXiv:2107.14203},
  year   = {2021}
}