中文

类别数据作为预测缺陷水表数据科学项目中的不速之客

机器学习 2021-02-08 v1

摘要

经过为期一年的实地研究努力,我们开发了一种基于机器学习的分类器,专门用于预测机械水表是否会随时间和密集使用而发生故障。我们使用从100万只水表的1500万次用水读数中推断的数据训练了循环深度神经网络(RNN)。用于训练的数据本质上分为两类:连续型与类别型。类别型是一种可基于某些定性属性取有限且固定数量可能值的数据类型;而连续型在此处为水表测得的用水量(立方米)数值。本文中,我们欲探讨如下事实:尽管基于连续数据我们的RNN预测准确率平均超过80%,但在训练阶段引入类别信息后,这些性能并未显著改善。从特定视角看,这仍是我们研究中一个未解决的关键问题。然而,若从数据科学角度思考这一争议性案例,我们意识到获得了如下确证:若无领域专家参与,便无法构建准确的机器学习方案,专家能区分不同类型数据(及其间关系)的重要性,各自具其意义、效度与影响。在最初的热潮退去后,数据科学正演进为一门多面学科,其中数据科学家/机器学习专家与领域专家的称谓是共生的。

关键词

引用

@article{arxiv.2102.03284,
  title  = {Categorical data as a stone guest in a data science project for predicting defective water meters},
  author = {Giovanni Delnevo and Marco Roccetti and Luca Casini},
  journal= {arXiv preprint arXiv:2102.03284},
  year   = {2021}
}