中文

评估最坏情形子人群中的模型性能

机器学习 2025-12-09 v2 计算机与社会 机器学习

摘要

当训练人口与实际操作中看到的人口不同时,ML 模型的性能会下降。为了评估分布鲁棒性,我们研究模型在给定大小的所有子人群上的最坏情况性能,这些子人群以核心属性 Z 为准则定义。这种鲁棒性概念可以考虑任意(连续)属性 Z,并自动考虑到不利群体中复杂的交叉性。我们开发了一种可扩展且原则性的两阶段估计程序,可以评估最先进模型的鲁棒性。我们证明我们的程序具有Several finite-sample 收敛保证,包括无维度收敛。与基于 Rademacher 复杂度的过于保守的做法相比,我们的评估误差仅通过对 Z 的条件性能估计中的样本外误差来依赖于 Z 的维度。在真实数据集上,我们展示了我们的方法认证了模型的鲁棒性,并防止了不可靠模型的部署。

关键词

引用

@article{arxiv.2407.01316,
  title  = {Evaluating Model Performance Under Worst-case Subpopulations},
  author = {Mike Li and Daksh Mittal and Hongseok Namkoong and Shangzhou Xia},
  journal= {arXiv preprint arXiv:2407.01316},
  year   = {2025}
}

备注

Earlier version appeared in the proceedings of Advances in Neural Information Processing Systems 34 (NeurIPS 2021): https://proceedings.neurips.cc/paper_files/paper/2021/file/908075ea2c025c335f4865f7db427062-Paper.pdf