联邦离线强化学习
机器学习
2024-01-30 v3 机器学习
统计方法学
摘要
基于证据或数据驱动的动力学治疗策略对个性化医疗至关重要,其可受益于离线强化学习(RL)。尽管各医疗机构拥有海量医疗数据,但因隐私限制而无法共享。此外,不同站点间存在异质性。因此,联邦离线RL算法对于处理这些问题必要且前景广阔。本文中,我们提出一个多站点马尔可夫决策过程模型,允许跨站点的同质与异质效应。所提模型使得对站点级特征的分析成为可能。我们设计了首个具有样本复杂度的离线RL联邦策略优化算法。所提算法通信高效,仅需通过交换汇总统计量进行单轮通信交互。我们给出了该算法的理论保证,其中所学策略的次优性可与数据未分布式时的速率相媲美。大量仿真证明了所提算法的有效性。该方法应用于多站点脓毒症数据集,以说明其在临床环境中的使用。
引用
@article{arxiv.2206.05581,
title = {Federated Offline Reinforcement Learning},
author = {Doudou Zhou and Yufeng Zhang and Aaron Sonabend-W and Zhaoran Wang and Junwei Lu and Tianxi Cai},
journal= {arXiv preprint arXiv:2206.05581},
year = {2024}
}