论数据集中同现模式的发现:污染物与儿童癌症的案例研究
数据库
2016-04-19 v4
摘要
我们旨在识别癌症病例与污染物排放之间的关系,并试图了解儿童癌症是否通常与某些特定的化学组合位于同一位置,或者是独立的。同现模式分析似乎是合适的调查方法。同现挖掘是空间数据挖掘的任务之一,侧重于检测同现模式,即频繁在空间上彼此邻近分布的空间特征集合。先前的大多数工作基于无事务的类 Apriori 算法,这些算法依赖于用户定义的阈值且专为布尔数据点设计。由于缺乏明确的事务概念,使用关联规则挖掘技术来解决同现挖掘问题并非易事。我们提出的方法基于地理空间的网格“事务化”,旨在挖掘具有扩展空间对象的数据集。我们的模型考虑了事务中特征存在的不确定性。使用统计检验代替全局阈值来检测显著的同现模式和规则。我们在合成数据集和真实数据集上评估了我们的方法。寻找环境与健康因素之间空间关联的研究人员可以使用该方法。此外,我们解释了用于污染物 (PRTR/NPRI) 和儿童癌症病例真实数据集的数据建模框架。
引用
@article{arxiv.1412.7282,
title = {On Discovering Co-Location Patterns in Datasets: A Case Study of Pollutants and Child Cancers},
author = {Jundong Li and Aibek Adilmagambetovm and Mohomed Shazan Mohomed Jabbar and Osmar R. Zaiane and Alvaro Osornio-Vargas and Osnat Wine},
journal= {arXiv preprint arXiv:1412.7282},
year = {2016}
}
备注
In GeoInformatica, 2016