基于标签损坏数据的机器学习鲁棒倾向得分计算方法
统计方法学
2018-01-11 v1 人工智能
机器学习
摘要
在生物统计学中,倾向得分是一种常用方法,用于分析协变量的不平衡并处理混杂协变量以消除组间差异。尽管存在大量计算倾向得分的方法,它们的共同问题是数据集中存在损坏的标签。例如,从患者收集的数据可能包含被错误治疗的样本,而计算方法可能将其作为误导性信息纳入。本文中,我们提出一种基于机器学习的方法来处理该问题。具体而言,我们利用大多数样本应被标以正确实例这一事实,设计了一种先通过谱聚类对数据进行聚类、再从聚类结果处理后的分布中抽样新数据集的方法。倾向得分由 Xgboost 计算,本文给出了我们方法的数学论证。实验结果表明,经我们方法处理的数据所计算的 xgboost 倾向得分优于使用原始数据的同一方法,且随着我们向数据集中加入一些人造损坏,我们方法的优势增大。同时,使用 xgboost 计算多处理的倾向得分也是该领域的一项开创性工作。
引用
@article{arxiv.1801.03132,
title = {Robust Propensity Score Computation Method based on Machine Learning with Label-corrupted Data},
author = {Chen Wang and Suzhen Wang and Fuyan Shi and Zaixiang Wang},
journal= {arXiv preprint arXiv:1801.03132},
year = {2018}
}
备注
26 pages, 4 figures, 8tables, to be submitted to peer-review journals soon