结合倾向性评分方法与变分自编码器在存在潜在子群时生成合成数据
机器学习
2023-12-14 v1
摘要
在需要基于临床队列生成合成数据的环境中,例如由于数据保护法规,个体间的异质性可能是一个我们需要控制或忠实保留的干扰因素。这种异质性的来源可能是已知的,例如由子群标签指示,也可能是未知的,因此仅反映在分布特性中,如双峰性或偏态。我们研究了在使用变分自编码器(VAEs)——一种利用低维潜在表示的生成式深度学习技术——获取合成数据时,如何保留和控制这种异质性。为了忠实再现反映在边缘分布中的未知异质性,我们提出将VAEs与预变换相结合。为了处理由子群引起的已知异质性,我们用群组成员资格模型,特别是来自倾向性评分回归的模型,来补充VAEs。评估通过一个包含子群和具有挑战性边缘分布的现实模拟设计进行。与纯粹关注边缘分布的合成数据方法相比,所提出的方法忠实地恢复了后者。倾向性评分增加了补充信息,例如在潜在空间中可视化时,并能支持采样具有或不具有子群特定特征的合成数据。我们还使用来自一项国际卒中试验的真实数据说明了所提出的方法,该试验显示出研究地点之间相当大的分布差异,以及双峰性。这些结果表明,通过统计方法(如倾向性评分回归)来描述异质性,可能更普遍地用于补充生成式深度学习,以获得忠实反映临床队列结构的合成数据。
引用
@article{arxiv.2312.07781,
title = {Combining propensity score methods with variational autoencoders for generating synthetic data in presence of latent sub-groups},
author = {Kiana Farhadyar and Federico Bonofiglio and Maren Hackenberg and Daniela Zoeller and Harald Binder},
journal= {arXiv preprint arXiv:2312.07781},
year = {2023}
}