合成医疗数据入门
机器学习
2024-07-04 v2
摘要
深度生成模型的最新进展极大地扩展了创建逼真合成医疗数据集的潜力。这些合成数据集旨在保留从敏感医疗数据集中得出的特征、模式和整体科学结论,同时不泄露患者身份或敏感信息。因此,合成数据可以促进安全的数据共享,从而支持一系列举措,包括开发新的预测模型、先进的医疗 IT 平台,以及一般的项目构思与假设开发。然而,许多问题和挑战依然存在,包括如何一致地评估合成数据集相较于原始真实数据集的相似性与预测效用,以及共享时的隐私风险。其他监管和治理问题也尚未得到广泛探讨。在这篇入门文章中,我们梳理了合成医疗数据的现状,包括生成与评估方法及工具、现有的部署实例、监管与伦理环境、访问与治理选项,以及进一步发展的机遇。
引用
@article{arxiv.2401.17653,
title = {A primer on synthetic health data},
author = {Jennifer A Bartell and Sander Boisen Valentin and Anders Krogh and Henning Langberg and Martin Bøgsted},
journal= {arXiv preprint arXiv:2401.17653},
year = {2024}
}