基于层次相关重构的收入数据可信度评估
机器学习
2019-04-23 v3 机器学习
摘要
在纳税申报或家庭预算分析等情形下,我们希望基于某些可用(内生)变量自动评估外生变量(申报收入)的可信度——我们旨在构建一个模型,并在所给数据样本上训练,以基于内生变量的值预测外生变量的(条件)概率分布。利用波兰家庭预算调查数据,本文将讨论层次相关重构(HCR)技术为此目的的一种简单且系统的适配,其可将统计学的可解释性与类似机器学习中对复杂密度的建模相结合。对于可信度评估,我们使用经验分布函数 将预测变量的边际分布归一化为 的 上均匀分布,随后将其条件分布 的密度建模为一组正交归一多项式的线性组合,其系数由其余变量的特征之线性组合来建模。这些系数可独立计算,具有类似于累积量的解释,且额外允许直接重构概率分布。对应高预测密度的值可视为可信,而低密度则暗示与数据样本统计不一致,例如可将评估为最不可信的选定比例数据点标记以进行人工核查。
引用
@article{arxiv.1812.08040,
title = {Credibility evaluation of income data with hierarchical correlation reconstruction},
author = {Jarek Duda and Adam Szulc},
journal= {arXiv preprint arXiv:1812.08040},
year = {2019}
}
备注
7 pages, 6 figures