在不访问真实原始数据的情况下生成和演化逼真合成测试数据的挑战——一项系统综述
机器学习
2026-02-09 v1 人工智能
摘要
背景:对使用电子政务服务数据作为输入的应用程序进行高级系统测试,需要既逼真又能保证个人信息隐私的测试数据。具有此类严格要求应用包括国家间的信息交换、医药、银行等。本综述旨在综合该领域当前的最佳实践。目标:本系统综述的目标是识别在不使用真实原始数据的情况下创建和演化合成测试数据的现有方法。方法:我们遵循了进行系统文献综述的成熟方法论,包括Kitchenham的方法以及分析我们综述局限性及其对有效性威胁的指南。结果:存在多种用于创建保护隐私的测试数据的方法和工具。我们的搜索在IEEE Xplore、ACM Digital Library和SCOPUS中找到了1013篇出版物。我们从其中75篇出版物中提取了数据,并确定了37种部分回答我们研究问题的方法。使用这些方法和工具的一个常见前提是直接访问真实数据进行数据匿名化或合成测试数据生成。我们确定了九种最接近回答我们研究问题的现有合成测试数据生成方法。尽管如此,还需要进一步的工作来为现有方法增加演化合成测试数据的能力。结论:没有一篇出版物完全满足我们的要求,只是部分满足。合成测试数据演化是一个尚未得到研究人员太多关注但需要在数字政府解决方案中探索的领域,特别是因为许多国家正在实施新的法律法规。
引用
@article{arxiv.2602.06609,
title = {The challenge of generating and evolving real-life like synthetic test data without accessing real-world raw data -- a Systematic Review},
author = {Maj-Annika Tammisto and Faiz Ali Shah and Daniel Rodriguez and Dietmar Pfahl},
journal= {arXiv preprint arXiv:2602.06609},
year = {2026}
}
备注
22 pages