基于强化学习的合成数据生成方法
机器学习
2026-01-27 v2
摘要
合成数据生成(SDG)是一种在保持患者隐私的同时,使生物医学研究中数据共享成为可能的前沿方法。然而,当前先进的生成模型通常需要大量数据和复杂的训练程序,限制了其在生物医学研究中常见的小样本情境下的适用性。本研究旨在开发更为原则且高效的SDG方法,并评估其在生物医学应用中的效能。本文将SDG重新建模为强化学习(RL)问题,引入RLSyn——一个新型框架,将数据生成器建模为患者记录上的随机策略,并使用基于判别器-derived奖励的近端策略优化(PPO)进行优化。我们在两个生物医学数据集上评估了RLSyn——AI-READI和MIMIC-IV——并对其进行了广泛的隐私性、实用性和忠实性评估。在MIMIC-IV数据集上,RLSyn在忠实性方面略优于扩散模型(S2R AUC 0.902 vs 0.906),同时在忠实性(NMI 0.001 vs 0.003;DWD 2.073 vs 2.797)和隐私风险(约0.50的成员推断风险AUC)方面实现可比水平。在较小的AI-READI数据集上,RLSyn再次匹配扩散模型的实用性(S2R AUC 0.873 vs 0.871),同时在忠实性(NMI 0.001 vs 0.002;DWD 13.352 vs 16.441)和成员推断攻击的脆弱性(AUC 0.544 vs 0.601)方面显著优于其。两种方法在两个数据集上的实用性和忠实性均显著优于GAN。我们的结果表明,强化学习提供了一种原则且有效的生物医学合成数据生成方法,尤其适用于数据稀缺的情境。
引用
@article{arxiv.2512.21395,
title = {A Reinforcement Learning Approach to Synthetic Data Generation},
author = {Natalia Espinosa-Dice and Nicholas J. Jackson and Chao Yan and Aaron Lee and Bradley A. Malin},
journal= {arXiv preprint arXiv:2512.21395},
year = {2026}
}