中文

通过采样改善不平衡数据中代表性不足观测的预测

机器学习 2021-12-17 v3 机器学习

摘要

数据不平衡在生产数据中十分常见,受控的生产设定要求数据落在狭窄的变化范围内,且数据收集以质量评估为目的,而非数据分析洞察。这种不平衡会对模型在代表性不足观测上的预测性能产生负面影响。我们提出通过采样来调整此种不平衡,旨在改善基于历史生产数据训练的模型性能。我们研究了三种用于调整不平衡的采样方法。目标是对训练数据中的协变量进行下采样,随后拟合回归模型。我们考察了使用采样数据或原始数据训练时模型预测能力的变化。我们将方法应用于来自青霉素生产先进模拟的大型生物制药制造数据集,发现使用采样数据拟合模型会使整体预测性能略有下降,但在代表性不足观测上系统性地表现更优。此外,结果强调了替代性、公平且均衡的模型评估的必要性。

关键词

引用

@article{arxiv.2111.09065,
  title  = {Sampling To Improve Predictions For Underrepresented Observations In Imbalanced Data},
  author = {Rune D. Kjærsgaard and Manja G. Grønberg and Line K. H. Clemmensen},
  journal= {arXiv preprint arXiv:2111.09065},
  year   = {2021}
}

备注

Presented at Workshop on Data-Centric AI (NeurIPS 2021); v2/v3 fixed incorrect axis labels