中文

理解弗林特住宅用水污染的数据科学方法

机器学习 2017-07-07 v1 应用统计 机器学习

摘要

当弗林特居民得知铅已污染其供水系统时,地方政府向他们免费提供了水质检测套件。市政府公布了这些检测结果,创建了一个宝贵的数据集,该数据集是理解弗林特铅污染事件成因与程度的关键。这是全国最大的关于市政供水系统中铅含量的数据集。在本文中,我们预测了每个家庭供水中的铅污染,并研究了弗林特水危机的几个相关方面,其中许多方面可推广至这座城市之外。例如,我们表明升高的铅风险可以从可观测的住房属性中(弱)预测。随后我们探究了与铅含量升高相关的因素。这些风险评估部分通过密歇根大学的众包预测挑战赛开发。为了让弗林特居民知晓这些评估,它们已被整合进由 \texttt{Google.org} 资助的网页与移动应用中。我们还探讨了居民检测项目中的自选择问题,考察了哪些因素与居民自愿采样水样的时机和频率相关。

关键词

引用

@article{arxiv.1707.01591,
  title  = {A Data Science Approach to Understanding Residential Water Contamination in Flint},
  author = {Alex Chojnacki and Chengyu Dai and Arya Farahi and Guangsha Shi and Jared Webb and Daniel T. Zhang and Jacob Abernethy and Eric Schwartz},
  journal= {arXiv preprint arXiv:1707.01591},
  year   = {2017}
}

备注

Applied Data Science track paper at KDD 2017. For associated promotional video, see https://www.youtube.com/watch?v=0g66ImaV8Ag