低保真合成数据的四项检查:披露控制与质量评估建议
应用统计
2025-03-19 v1
摘要
机密行政数据通常仅在可信研究环境 (TRE) 内对研究人员可用。最近,英国一些研究组提出将低保真合成数据 (LFSD) 提供给 TRE 外部的研究人员,以允许代码测试和数据发现。需要保持透明度,使访问 LFSD 的研究人员了解其创建方式以及可预期从中获得什么。LFSD 中变量之间的关系并未保留,但其发布可能导致真实或看似数据泄露的情况。为使 LFSD 对研究人员的初步分析有用,它需要满足一些最低质量标准。使用 LFSD 的研究人员需要清楚地了解和记录其与在 TRE 中访问的数据之间的差异。我们建议在发布 LFSD 之前由数据控制者运行这些检查,以确保其记录完善、有用且不泄露。1. 标注:为避免看似数据泄露,必须采取措施确保合成数据被明确标识为非真实数据。2. 披露:LFSD 应接受如下所述的披露风险评估,并缓解已识别的任何风险。3. 结构:合成数据的结构应尽可能与 TRE 数据相似。4. 文档记录:合成数据与 TRE 数据之间的结构差异必须加以记录,并阐明对合成数据的分析预期与对 TRE 数据的分析之间的差异。我们在下文详细阐述了每项检查的具体内容;但不应采用严格的基于规则的方法。相反,数据持有者应根据可能披露的信息类型和数据发布情况(向谁发布以及在何种条件下)调整规则。
引用
@article{arxiv.2503.14211,
title = {Four checks for low-fidelity synthetic data: recommendations for disclosure control and quality evaluation},
author = {Gillian M Raab and Sophie McCall and Liam Cavin},
journal= {arXiv preprint arXiv:2503.14211},
year = {2025}
}