中文

面向分布外学习的模型无关样本重加权

机器学习 2023-01-25 v1

摘要

分布鲁棒优化(DRO)与不变风险最小化(IRM)是两种旨在提升机器学习模型分布外(OOD)泛化性能的流行方法。尽管对小型模型有效,但已观察到这些方法在大型过参数化模型下易受过拟合影响。本工作提出一种原则性方法,模型无关样本重加权(MAPLE),以有效解决OOD问题,尤其在过参数化场景中。我们的核心思想是寻找训练样本的有效重加权,使得大型模型在加权训练数据上经标准经验风险最小化训练后获得优越的OOD泛化性能。过拟合问题通过考虑双层公式来搜索样本重加权得以解决,其中泛化复杂度取决于样本权重的搜索空间而非模型规模。我们在线性情形下给出理论分析以证明MAPLE对模型规模的不敏感性,并经实验验证其以大幅优势超越最先进方法。代码见\url{https://github.com/x-zho14/MAPLE}。

关键词

引用

@article{arxiv.2301.09819,
  title  = {Model Agnostic Sample Reweighting for Out-of-Distribution Learning},
  author = {Xiao Zhou and Yong Lin and Renjie Pi and Weizhong Zhang and Renzhe Xu and Peng Cui and Tong Zhang},
  journal= {arXiv preprint arXiv:2301.09819},
  year   = {2023}
}