定义“好”: 合成智能表计数据评估框架
机器学习
2024-10-23 v1
摘要
获取粒度化需求数据对于实现净零转型至关重要;这有助于准确描绘用户需求轮廓,并在可变可再生能源发展日益增长的背景下,实现主动需求管理。然而,由于隐私顾虑,这些数据往往难以公开发布。高质量的合成数据可作为解决方案。尽管在生成合成智能表计数据方面已有大量研究,但仍缺乏一致的评估框架。本文探讨了如何将其他行业用于合成数据的常见框架应用于智能表计数据,包括保真度、实用性和隐私性。我们还推荐了特定指标,以确保智能表计数据的关键特性得以保留,并测试了使用差分隐私保护隐私的程度。我们表明,标准的隐私攻击方法,如重构攻击或成员推断攻击,对于评估智能表计数据集的隐私风险不够。我们提出了改进方法:注入带有不合理离群值的训练数据,然后直接对这些离群值发起隐私攻击。ε值(隐私损失指标)的选择对隐私风险影响显著,凸显了在保真度与隐私性之间进行权衡时,必须进行这些明确的隐私测试的必要性。
引用
@article{arxiv.2407.11785,
title = {Defining 'Good': Evaluation Framework for Synthetic Smart Meter Data},
author = {Sheng Chai and Gus Chadney and Charlot Avery and Phil Grunewald and Pascal Van Hentenryck and Priya L. Donti},
journal= {arXiv preprint arXiv:2407.11785},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication