隐私感知与公众对齐:将风险检测与公共价值观嵌入可扩展的临床文本去标识化以用于可信研究环境
密码学与安全
2025-06-04 v1
摘要
临床自由文本数据提供了巨大的潜力来改善人群健康研究,例如更丰富的表型分析、症状追踪以及对患者护理的情境理解。然而,由于嵌入在非结构化叙述中的直接或间接识别信息的存在,这些数据带来了重大的隐私风险。虽然已经开发了许多去标识化工具,但很少有工具在大规模的真实世界异构数据集上进行过测试,或接受过治理就绪评估。在本文中,我们综合了以往研究的发现,考察了苏格兰多个文档类型和 NHS 数据提供者的隐私风险格局。我们描述了直接和间接标识符如何因记录类型、临床环境和数据流而异,并展示了文档实践的变化如何随时间推移降低模型性能。通过公众参与,我们探讨了围绕临床自由文本安全使用的社会期望,并将其反映在隐私风险管理原型工具的设计中,以支持透明、可审计的决策。我们的发现强调,隐私风险具有上下文依赖性和累积性,凸显了需要结合基于规则的精度与上下文理解的自适应、混合去标识化方法。我们提供了一个基于技术证据和负责任数据使用公众视角的全面视图,涵盖了在可信研究环境及更广泛范围内安全、可扩展地重用临床自由文本的挑战与机遇。
引用
@article{arxiv.2506.02063,
title = {Privacy-Aware, Public-Aligned: Embedding Risk Detection and Public Values into Scalable Clinical Text De-Identification for Trusted Research Environments},
author = {Arlene Casey and Stuart Dunbar and Franz Gruber and Samuel McInerney and Matúš Falis and Pamela Linksted and Katie Wilde and Kathy Harrison and Alison Hamilton and Christian Cole},
journal= {arXiv preprint arXiv:2506.02063},
year = {2025}
}