迈向生物合理且隐私保护的基因表达数据生成
密码学与安全
2024-02-08 v1 机器学习
摘要
采用差分隐私(Differential Privacy, DP)训练的生成模型在为下游应用创建合成数据方面日益突出。然而,现有文献主要关注基础基准数据集,并且倾向于仅报告在基本指标和相对简单的数据分布上的良好结果。在本文中,我们启动了一项系统分析,研究 DP 生成模型在其自然应用场景中的表现,特别关注真实世界的基因表达数据。我们对五种代表性的差分隐私生成方法进行了全面分析,从下游效用、统计特性和生物合理性等多个角度进行考察。我们广泛的评估阐明了每种差分隐私生成方法的独特特征,为每种方法的优缺点提供了关键见解,并揭示了未来发展的有趣可能性。也许令人惊讶的是,我们的分析表明,根据现有文献中考虑的标准评估指标,大多数方法能够实现看似合理的下游效用。然而,我们发现没有一种差分隐私方法能够准确捕捉真实数据集的生物学特征。这一观察表明,当前对该领域方法的评估可能过于乐观,并凸显了未来在模型设计方面进行改进的迫切需求。
引用
@article{arxiv.2402.04912,
title = {Towards Biologically Plausible and Private Gene Expression Data Generation},
author = {Dingfan Chen and Marie Oestreich and Tejumade Afonja and Raouf Kerkouche and Matthias Becker and Mario Fritz},
journal= {arXiv preprint arXiv:2402.04912},
year = {2024}
}