统计与机器学习方法生成环境 PM$_{2.5}$ 浓度全国日尺度地图的比较
应用统计
2020-02-19 v1
摘要
空气污染流行病学中的一个典型问题是对拥有健康数据的个体进行暴露评估。由于监测站点稀疏且空气污染物浓度测量的时间频率有限(对多数污染物为每 3 或 6 天一次),流行病学家已逐渐不再仅使用测量值来刻画环境空气污染暴露。过去几年中,大量研究工作致力于开发统计方法或机器学习技术,以生成更精细空间与时间尺度(通常为每日)且全覆盖的空气污染估计值。其中部分方法包括:地统计技术如克里金法;利用空气质量模型输出信息的空间统计模型(统计降尺度模型);挖掘 GIS 协变量信息的线性回归建模方法(土地利用回归);或挖掘相关变量信息的机器学习方法(神经网络与深度学习方法)。尽管其中一些暴露建模方法已用于若干空气污染流行病学研究,但目前尚不清楚这些方法生成的预测暴露值差异多大,以及哪种方法生成更可靠的估计。本文旨在通过评估多种暴露建模方法、比较其预测性能与计算难度来填补这一空白。以 2011 年北美大陆 PM 为案例,我们考察了各方法在季节间、城乡环境间以及 PM 浓度水平(低、中、高)上的表现。
引用
@article{arxiv.1904.08931,
title = {A comparison of statistical and machine learning methods for creating national daily maps of ambient PM$_{2.5}$ concentration},
author = {Veronica J. Berrocal and Yawen Guan and Amanda Muyskens and Haoyu Wang and Brian J Reich and James A. Mulholland and Howard H. Chang},
journal= {arXiv preprint arXiv:1904.08931},
year = {2020}
}