特征加权最大代表性亚采样
机器学习
2026-03-03 v1
摘要
在社会科学领域,往往需要在可获得有效结论之前消除调查和研究中的偏差。去偏算法通过样本权重实现偏差的计算删除。然而,当只有部分特征高度偏斜,而其余特征已具代表性时,便出现问题。算法需要强烈改变样本分布以处理少数高度偏斜特征,这反过来可能引入到已经具代表性变量中的偏差。为此,我们开发了一种使用特征权重来最小化高度偏斜特征对样本权重计算影响的方法。我们的算法基于最大代表性亚采样 (MRS),通过迭代删除元素来创建代表性亚样本,以将非representative sample 与 representative sample 对齐。新的算法称为特征加权 MRS (FW-MRS),通过对高度偏斜特征的强调度降低,使其能够保留更多的实例用于下游任务。特征权重来源于用于区分 representative 和 non-representative 数据集的 domain classifier 的 feature importance。我们使用八个 tabular 数据集进行了 FW-MRS 的验证,每个数据集我们人工制造了偏斜。偏斜特征对下游任务可能具有重要性,关注它们可能导致泛化性能下降。因此,我们评估了 FW-MRS 在下游任务上的泛化性能,发现没有统计学上的显著差异。此外,我们将 FW-MRS 应用于社会科学的真实世界数据集。源代码可在 https://github.com/kramerlab/FeatureWeightDebiasing 上获取。
引用
@article{arxiv.2603.01013,
title = {Feature-Weighted Maximum Representative Subsampling},
author = {Tony Hauptmann and Stefan Kramer},
journal= {arXiv preprint arXiv:2603.01013},
year = {2026}
}