中文

关于使用可解释机器学习进行数据质量管理

机器学习 2020-07-30 v1 人工智能 机器学习

摘要

数据质量对于任何需要分析以支持决策的应用都是一个重大问题。当我们关注物联网(IoT)时,它变得非常重要,其中众多设备可交互以交换和处理数据。IoT设备连接到边缘计算(EC)节点以报告所收集的数据,因此,我们必须在IoT以及网络边缘确保数据质量。在本文中,我们聚焦于该具体问题,并提出使用可解释机器学习来提供对任一数据处理活动而言重要的特征。我们的目标至少是为一经检测为数据集中显著的特征保障数据质量。我们必须注意到,所选特征与每个数据集中其余特征呈现最高相关性,因此可被用于降维。我们聚焦于多种在学习的模型中实现可解释性的方法,并采用集成方案进行最终决策。我们的方案能够及时检索最终结果并高效选择适当特征。我们通过大量仿真评估我们的模型并给出数值结果。我们的目的是揭示其在我们所创建的各种改变机制中采用的一组参数的实验场景下的性能。

关键词

引用

@article{arxiv.2007.14677,
  title  = {On the Use of Interpretable Machine Learning for the Management of Data Quality},
  author = {Anna Karanika and Panagiotis Oikonomou and Kostas Kolomvatsos and Christos Anagnostopoulos},
  journal= {arXiv preprint arXiv:2007.14677},
  year   = {2020}
}