中文

k-匿名化与合成数据技术的能耗及机器学习精度影响

机器学习 2023-10-31 v2 人工智能

摘要

为应对社会日益增长的隐私与气候关切,欧盟通过了《通用数据保护条例》(GDPR)并承诺实施绿色新政(Green Deal)。大量研究探讨了软件的能源效率以及基于匿名数据集训练的机器学习模型的精度。近期工作开始探索隐私增强技术(PET)对机器学习模型能耗与精度的双重影响,聚焦于 k-匿名。由于合成数据正成为一种日益流行的 PET,本文分析了两个阶段的能耗与精度:a) 对目标数据集应用隐私增强技术,b) 在目标隐私增强数据集上训练模型。我们使用两种隐私增强技术:k-匿名化(采用泛化与抑制)和合成数据,以及三种机器学习模型。每个模型均在每种隐私增强数据集上训练。我们的结果表明,在 k-匿名化数据上训练的模型比在原始数据上训练的模型消耗更少能量,且精度表现相近。在合成数据上训练的模型与在原始数据上训练的模型相比,能耗相近,精度相似或更低。

关键词

引用

@article{arxiv.2305.07116,
  title  = {Energy cost and machine learning accuracy impact of k-anonymisation and synthetic data techniques},
  author = {Pepijn de Reus and Ana Oprescu and Koen van Elsen},
  journal= {arXiv preprint arXiv:2305.07116},
  year   = {2023}
}

备注

Published in the proceedings (Pages: 57-65) of The International Conference on Information and Communications Technology for Sustainability (ICT4S) 2023 in Rennes, France. 9 pages, 4 figures, 5 tables