通过偏置去除与数据不完备缓解的上下文驱动数据挖掘
机器学习
2019-10-22 v1 社会与信息网络
机器学习
摘要
数据挖掘工作的结果主要由数据质量驱动。在这些部署中,严重的阻碍性问题仍未解决,例如:数据收集歧义、数据不平衡、数据中隐藏的偏置、领域信息的缺失以及数据不完备。本文基于这样一个前提:上下文有助于缓解这些问题。上下文驱动的数据科学生命周期(C-DSL)——本文的主要贡献——被构建以应对这些挑战。我们开发了两项案例研究(使用来自体育赛事的数据集)来测试 C-DSL。两项案例研究的结果使用常见的数据挖掘指标进行评估,如:决定系数(R2 值)和混淆矩阵。本文所呈现的工作旨在重新定义该生命周期,并为其结果带来切实的改进。
引用
@article{arxiv.1910.08670,
title = {Context-Driven Data Mining through Bias Removal and Data Incompleteness Mitigation},
author = {Feras A. Batarseh and Ajay Kulkarni},
journal= {arXiv preprint arXiv:1910.08670},
year = {2019}
}
备注
1st Workshop on Evaluation and Experimental Design in Data Mining and Machine Learning (EDML 2019) At SIAM - Society for Industrial and Applied Mathematics