为何丢弃数据能改善最坏组误差?
机器学习
2023-02-23 v2 机器学习
摘要
面对类别或组不平衡的数据时,实践者遵循一种引人入胜的策略以取得最佳结果。他们丢弃样本直至各类别或组规模平衡,然后对缩减后的训练集执行经验风险最小化。这与学习理论中的常识相悖,后者认为期望误差应随数据集规模增大而下降。本工作中,我们利用极值理论来解决这一表面矛盾。我们的结果表明,数据分布的尾部在决定线性分类器的最坏组准确率方面起着重要作用。当在重尾数据上学习时,丢弃数据恢复了所得分类器的几何对称性,从而改善其最坏组泛化能力。
引用
@article{arxiv.2205.11672,
title = {Why does Throwing Away Data Improve Worst-Group Error?},
author = {Kamalika Chaudhuri and Kartik Ahuja and Martin Arjovsky and David Lopez-Paz},
journal= {arXiv preprint arXiv:2205.11672},
year = {2023}
}