面向含个人信息多数据集的不可轻易辨识数据协作分析
机器学习
2022-09-01 v1 密码学与安全
摘要
多源数据融合通过联合分析多个数据源以获得改进的信息,已受到相当多的研究关注。对于多个医疗机构的数据集,数据保密性和跨机构通信至关重要。在这种情况下,通过共享降维后的中间表示而无需迭代的跨机构通信的数据协作(DC)分析可能是合适的。当分析包含个人信息的数据时,共享数据的可辨识性至关重要。本研究考察了 DC 分析的可辨识性。结果揭示,对于监督学习,共享的中间表示易于被辨识回原始数据。本研究随后提出了一种不可轻易辨识的 DC 分析,仅共享不可轻易辨识的数据,用于包含个人信息的多个医疗数据集。所提方法基于随机样本置换、可解释 DC 分析的概念以及使用无法重构的函数,解决了可辨识性担忧。在医疗数据集的数值实验中,所提方法在保持传统 DC 分析高识别性能的同时表现出不可轻易辨识性。对于某医院数据集,所提方法相比仅使用本地数据集的本地分析在识别性能上提升了九个百分点。
引用
@article{arxiv.2208.14611,
title = {Non-readily identifiable data collaboration analysis for multiple datasets including personal information},
author = {Akira Imakura and Tetsuya Sakurai and Yukihiko Okada and Tomoya Fujii and Teppei Sakamoto and Hiroyuki Abe},
journal= {arXiv preprint arXiv:2208.14611},
year = {2022}
}
备注
19 pages, 3 figures, 7 tables