中文

关于过参数化模型如何避免加剧伪相关

机器学习 2022-06-28 v1

摘要

即便结合传统的缓解不均衡技术,过参数化模型在数据不均衡时仍无法良好泛化。本文关注不均衡分类数据集,其中一小部分群体——少数类——可能含有与类标伪相关的特征。针对参数化的一族交叉熵损失修正项与一个代表性高斯混合模型,我们推导了关于最坏组误差的非渐近泛化界,从而阐明不同超参数的作用。具体而言,我们证明当适当调参时,近期提出的 VS-loss 学到的模型即便在伪特征强烈时对少数类也是公平的。另一方面,替代启发式方法如加权 CE 与 LA-loss 可能彻底失败。相较先前工作,我们的界适用于更一般的模型,是非渐近的,且即便在极度不均衡情形下也成立。

关键词

引用

@article{arxiv.2206.12739,
  title  = {On how to avoid exacerbating spurious correlations when models are overparameterized},
  author = {Tina Behnia and Ke Wang and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2206.12739},
  year   = {2022}
}

备注

Short version published at ISIT 2022