大规模假名化:OLCF的Summit使用数据案例研究
分布式、并行与集群计算
2023-02-03 v1 数字图书馆
摘要
海量数据的分析和复杂计算作业的处理传统上依赖于高性能计算(HPC)系统。理解这些分析的需求对于设计能够带来更好科学的解决方案至关重要,同样,理解这些系统上用户行为的特征对于改善HPC系统上的用户体验也很重要。收集用户行为数据的一种常见方法是分析仅系统管理员可用的系统日志数据。然而,最近在橡树岭领导计算设施(OLCF),我们通过使用普通Unix命令从用户视角收集数据,揭示了关于Summit超级计算机的用户行为。在此,我们讨论了在准备将此数据集发布并提交给一个开放数据挑战赛的过程中所涉及的过程、挑战和经验教训。原始数据集包含关于OLCF用户的个人可识别信息(PII),在发布前需要对其进行掩码处理,我们确定,完全清除PII的匿名化会破坏太多数据结构,导致其对数据挑战赛失去吸引力。我们转而选择对数据集进行假名化,以降低其与用户身份的可链接性。假名化在计算上比匿名化昂贵得多,而我们数据集的大小(约1.75亿行原始文本)使得开发一个可在不同HPC机器上复用的并行化工作流成为必要。我们展示了该工作流在OLCF的两台顶级HPC系统上的扩展行为,并表明我们能够将整体完工时间从单节点上不切实际的20多小时缩短到大约2小时。作为这项工作的成果,我们发布了整个假名化数据集,并公开提供了工作流和源代码。
引用
@article{arxiv.2212.09616,
title = {Pseudonymization at Scale: OLCF's Summit Usage Data Case Study},
author = {Ketan Maheshwari and Sean R. Wilkinson and Alex May and Tyler Skluzacek and Olga A. Kuchar and Rafael Ferreira da Silva},
journal= {arXiv preprint arXiv:2212.09616},
year = {2023}
}
备注
9 pages, 5 figures, accepted to BTSD 2022 workshop (see https://sites.google.com/view/btsd2022 for more information), to be published in the proceedings of IEEE Big Data 2022