Hide-and-Seek 隐私挑战赛
机器学习
2020-07-27 v2 密码学与安全
计算机与社会
机器学习
摘要
临床时间序列环境对数据建模与共享提出了独特的综合挑战。由于临床时间序列的高维性,使用常见去标识化技术难以在保护隐私的同时保留数据效用以实现充分的去标识化。对此问题的一个创新方法是合成数据生成。从技术角度看,好的时间序列生成模型应保留时间动态性,即新序列尊重高维变量间跨时间的原始关系。从隐私角度看,模型应通过限制对成员推断攻击的脆弱性来防止患者再识别。NeurIPS 2020 Hide-and-Seek 隐私挑战赛是一项新颖的双赛道竞赛,旨在同时推动解决这两个问题。在我们的正面对抗形式中,合成数据生成赛道(即“隐藏者”)与患者再识别赛道(即“搜寻者”)通过一个新的高质量重症监护时间序列数据集 AmsterdamUMCdb 直接相互对抗。最终,我们力求推进针对密集高维时间数据流的生成技术,使其(1)在保真度与可预测性方面具有临床意义,且(2)能在患者再识别这一具体概念下最小化成员隐私风险。
引用
@article{arxiv.2007.12087,
title = {Hide-and-Seek Privacy Challenge},
author = {James Jordon and Daniel Jarrett and Jinsung Yoon and Tavian Barnes and Paul Elbers and Patrick Thoral and Ari Ercole and Cheng Zhang and Danielle Belgrave and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2007.12087},
year = {2020}
}
备注
19 pages, 5 figures. Part of the NeurIPS 2020 competition track