中文

利用变分自编码器为具有缺失值的日志数据构建保守策略

机器学习 2022-03-10 v1

摘要

在医疗保健等数据驱动决策的高风险应用中,学习一个在存在不确定性时最大化奖励同时避免潜在危险动作的策略至关重要。这个问题通常面临两个主要挑战。首先,由于此类应用的关键性质,通过在线探索进行学习是不可能的。因此,我们需要求助于没有反事实的观测数据集。其次,这类数据集通常是不完美的,并且额外受到特征属性中缺失值的困扰。在本文中,我们考虑当训练和测试数据的特征属性中存在缺失值时,使用日志数据构建个性化策略的问题。目标是当观测到\Xt\Xt\Xb\Xb的带有缺失值的退化版本)时,推荐一个动作(治疗)。我们考虑了三种处理缺失的策略。特别是,我们引入了\textit{保守策略},其中策略被设计为安全地处理由缺失引起的不确定性。为了实现这一策略,我们需要估计后验分布p(\Xb\Xt)p(\Xb|\Xt),我们使用变分自编码器来实现这一点。特别是,我们的方法基于部分变分自编码器(PVAE),这些编码器旨在捕获具有缺失值的特征的底层结构。

关键词

引用

@article{arxiv.2109.03747,
  title  = {Conservative Policy Construction Using Variational Autoencoders for Logged Data with Missing Values},
  author = {Mahed Abroshan and Kai Hou Yip and Cem Tekin and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2109.03747},
  year   = {2022}
}