中文

利用包装决策时间中的因果性进行强化学习

机器学习 2025-05-08 v3 机器学习

摘要

我们考虑针对一类具有包装决策时间的强化学习(RL)。一个包装包含一系列连续决策时间。在包装内部,转换动力学是非马尔可夫且非平稳的。包装内的所有动作共同影响单个奖励,该奖励在包装结束时被观察到。例如,在移动健康领域,多个活动建议在一天中共同影响用户每天保持活跃的承诺。我们的目标是开发一个在线 RL 算法来最大化包装特定奖励的折扣总和。为了处理包装内部的非马尔可夫转换,我们利用专家提供的因果有向无环图(DAG)。基于 DAG,我们将状态构建为观察历史的动力学贝叶斯充分统计量,这导致包装内部和跨包装的马尔可夫状态转换。我们将此问题表述为一个周期马尔可夫决策过程(MDP),该过程允许在周期内非平稳性。我们推广基于平稳 MDP 的 Bellman 方程的在线 RL 算法以处理周期 MDP。我们证明,我们构建的状态在所有状态构建中实现了最大的最优值函数。最后,我们在基于真实数据的移动健康临床试验中构建的测试变体上对所提出的方法进行了评估。

关键词

引用

@article{arxiv.2410.14659,
  title  = {Harnessing Causality in Reinforcement Learning With Bagged Decision Times},
  author = {Daiqi Gao and Hsin-Yu Lai and Predrag Klasnja and Susan A. Murphy},
  journal= {arXiv preprint arXiv:2410.14659},
  year   = {2025}
}