中文

从统计视角重新审视数据集偏差问题

机器学习 2024-02-07 v1

摘要

在本文中,我们从统计学的角度研究“数据集偏差”问题,并确定问题的主要原因是输入 xx 中类别属性 uu 与非类别属性 bb 之间的强相关性,表现为 p(ub)p(u|b)p(u)p(u) 显著不同。由于 p(ub)p(u|b) 作为采样分布的一部分出现在标准最大对数似然目标中,通过最大对数似然在有偏数据集上训练的模型会固有地将这种相关性纳入其参数,导致对无偏测试数据的泛化能力差。基于这一观察,我们提出通过对每个样本 nn 的目标函数加权 1p(unbn)\frac{1}{p(u_{n}|b_{n})} 或以与 1p(unbn)\frac{1}{p(u_{n}|b_{n})} 成正比的权重采样该样本来缓解数据集偏差。虽然两种方法在统计上是等价的,但前者在实践中证明更稳定有效。此外,我们在我们的去偏方法与因果推理之间建立了联系,从而加强了方法的理论基础。然而,当偏差标签不可用时,精确计算 p(ub)p(u|b) 是困难的。为克服这一挑战,我们提出使用以“偏差放大”损失训练的有偏分类器来近似 1p(ub)\frac{1}{p(u|b)}。在各种有偏数据集上的大量实验表明,在大多数设置下,我们的方法优于现有的去偏技术,验证了我们的理论分析。

关键词

引用

@article{arxiv.2402.03577,
  title  = {Revisiting the Dataset Bias Problem from a Statistical Perspective},
  author = {Kien Do and Dung Nguyen and Hung Le and Thao Le and Dang Nguyen and Haripriya Harikumar and Truyen Tran and Santu Rana and Svetha Venkatesh},
  journal= {arXiv preprint arXiv:2402.03577},
  year   = {2024}
}