以透明方式开展能源建模工作:电厂数据库中的数据质量问题
计算机与社会
2018-09-05 v1 数据库
摘要
在能源建模中,开放数据与开源代码有助于增强模型工作的可追溯性与可复现性,从而推动争议性讨论并改进政策建议。尽管近年来开放电厂数据库的可用性有所增加,但它们彼此之间往往存在显著差异,且其数据质量尚未与专有来源进行系统比较。在此,我们介绍基于 Python 的“powerplantmatching”(PPM),一个用于清理、标准化和合并多个电厂数据库的开源工具集。我们将其仅用于开放数据库一次,另一次加入一个额外的专有数据库,通过分析常规电厂的容量、国家、燃料类型、地理坐标和投运年份,来讨论和阐明数据质量问题。我们发现,纯粹基于开放数据的派生数据集尚不能与加入了专有数据库的匹配所得数据集相媲美,尽管容量的统计数值在两种数据集下大体吻合。当最终数据集的建模需要投运年份时,专有数据库对提升派生数据集的质量起着关键帮助作用。
引用
@article{arxiv.1809.00974,
title = {Performing energy modelling exercises in a transparent way the issue of data quality in power plant databases},
author = {Fabian Gotzens and Heidi Heinrichs and Jonas Hörsch and Fabian Hofmann},
journal= {arXiv preprint arXiv:1809.00974},
year = {2018}
}