基准测试空气质量科学机器学习模型
机器学习
2026-03-30 v2
摘要
精准的空气质量指数(AQI)预测对于保护快速增长城市地区的公共健康至关重要,而实际的模型评估与选择往往因缺乏在标准化数据集上的严谨、地区特定的基准测试而受到挑战。物理引导的机器学习和深度学习模型可能是解决此类问题的有效方案,能够实现更精确和更高效的AQI预测。本研究提出了一种可解释且全面的基准测试,为指南方针并提出物理引导的最佳模型,通过对北德克萨斯州(达拉斯县)多步预测AQI的经典时间序列、机器学习和深度学习方法进行基准测试。利用2022至2024年美国环境保护署(EPA)公开的日常空气质量观测数据,我们对PM2.5和O3进行城市级别时间序列聚合,并构建滞后预测数据集,其中LAG取值为{1,7,14,30}天。为进行基准测试,评估线性回归(LR)、SARIMAX、多层感知器(MLP)和LSTM网络,并提出采用加权损失将EPA断点基准AQI公式纳入一致性约束的物理引导变体(MLP+Physics和LSTM+Physics)。使用按时间顺序划分的训练-测试分割以及MAE、RMSE等误差指标进行实验,结果显示深度学习模型优于更简单的方法,而物理引导可提高稳定性并产生物理上一致的污染物与AQI关系,其中对短期预测以及PM2.5和O3的益处最大。总体而言,结果为北德克萨斯州选择AQI预测模型提供了实用参考,并阐明了在不同污染物和预测时段中,轻量级物理约束何时会显著性地改善预测性能。
引用
@article{arxiv.2603.21039,
title = {Benchmarking Scientific Machine Learning Models for Air Quality Data},
author = {Khawja Imran Masud and Venkata Sai Rahul Unnam and Sahara Ali},
journal= {arXiv preprint arXiv:2603.21039},
year = {2026}
}
备注
Accepted at IEEE IGARSS 2026; 22 pages, 6 figures;