中文

联邦离线强化学习

机器学习 2024-01-30 v3 机器学习 统计方法学

摘要

基于证据或数据驱动的动力学治疗策略对个性化医疗至关重要,其可受益于离线强化学习(RL)。尽管各医疗机构拥有海量医疗数据,但因隐私限制而无法共享。此外,不同站点间存在异质性。因此,联邦离线RL算法对于处理这些问题必要且前景广阔。本文中,我们提出一个多站点马尔可夫决策过程模型,允许跨站点的同质与异质效应。所提模型使得对站点级特征的分析成为可能。我们设计了首个具有样本复杂度的离线RL联邦策略优化算法。所提算法通信高效,仅需通过交换汇总统计量进行单轮通信交互。我们给出了该算法的理论保证,其中所学策略的次优性可与数据未分布式时的速率相媲美。大量仿真证明了所提算法的有效性。该方法应用于多站点脓毒症数据集,以说明其在临床环境中的使用。

关键词

引用

@article{arxiv.2206.05581,
  title  = {Federated Offline Reinforcement Learning},
  author = {Doudou Zhou and Yufeng Zhang and Aaron Sonabend-W and Zhaoran Wang and Junwei Lu and Tianxi Cai},
  journal= {arXiv preprint arXiv:2206.05581},
  year   = {2024}
}