评估最坏情形子人群中的模型性能
机器学习
2025-12-09 v2 计算机与社会
机器学习
摘要
当训练人口与实际操作中看到的人口不同时,ML 模型的性能会下降。为了评估分布鲁棒性,我们研究模型在给定大小的所有子人群上的最坏情况性能,这些子人群以核心属性 Z 为准则定义。这种鲁棒性概念可以考虑任意(连续)属性 Z,并自动考虑到不利群体中复杂的交叉性。我们开发了一种可扩展且原则性的两阶段估计程序,可以评估最先进模型的鲁棒性。我们证明我们的程序具有Several finite-sample 收敛保证,包括无维度收敛。与基于 Rademacher 复杂度的过于保守的做法相比,我们的评估误差仅通过对 Z 的条件性能估计中的样本外误差来依赖于 Z 的维度。在真实数据集上,我们展示了我们的方法认证了模型的鲁棒性,并防止了不可靠模型的部署。
引用
@article{arxiv.2407.01316,
title = {Evaluating Model Performance Under Worst-case Subpopulations},
author = {Mike Li and Daksh Mittal and Hongseok Namkoong and Shangzhou Xia},
journal= {arXiv preprint arXiv:2407.01316},
year = {2025}
}
备注
Earlier version appeared in the proceedings of Advances in Neural Information Processing Systems 34 (NeurIPS 2021): https://proceedings.neurips.cc/paper_files/paper/2021/file/908075ea2c025c335f4865f7db427062-Paper.pdf