中文

RealPatch:一种基于真实样本的统计匹配模型修补框架

计算机视觉与模式识别 2022-08-04 v1

摘要

机器学习分类器通常训练为最小化数据集上的平均误差。不幸的是,在实践中,这一过程常常利用由训练数据中子组不平衡引起的虚假相关性,导致平均性能高但在各子组间性能差异很大。近期解决该问题的工作提出了使用 CAMEL 进行模型修补。先前的这种方法使用生成对抗网络执行类内子组间数据增强,需要(a)训练若干计算昂贵的模型,以及(b)给定领域中模型合成输出具有足够质量。在这项工作中,我们提出 RealPatch,一种基于统计匹配的更简单、更快且数据效率更高的数据增强框架。我们的框架通过使用真实样本增强数据集来执行模型修补,减轻了对目标任务训练生成模型的需要。我们在三个基准数据集 CelebA、Waterbirds 和 iWildCam 的一个子集上展示了 RealPatch 的有效性,在二元分类中显示出最差情况子组性能和子组性能差距的改善。此外,我们使用具有 211 类的 imSitu 数据集进行实验,这是基于生成模型的修补(如 CAMEL)不切实际的场景。我们表明 RealPatch 能成功消除数据集泄漏,同时减少模型泄漏并保持高实用性。RealPatch 的代码可在 https://github.com/wearepal/RealPatch 找到。

关键词

引用

@article{arxiv.2208.02192,
  title  = {RealPatch: A Statistical Matching Framework for Model Patching with Real Samples},
  author = {Sara Romiti and Christopher Inskip and Viktoriia Sharmanska and Novi Quadrianto},
  journal= {arXiv preprint arXiv:2208.02192},
  year   = {2022}
}