中文

面向动态治疗策略的Q函数最小信息散度

统计方法学 2022-11-17 v1 机器学习

摘要

本文旨在提出信息几何在强化学习中针对动态治疗策略的新应用。在强化学习的标准框架中,Q函数被定义为在单阶段情形下给定状态和动作的奖励的条件期望。我们在所有Q函数的空间中引入一种称为策略等价的关系。针对每个阶段,在Q函数空间中定义了一类信息散度。主要目标是通过基于轨迹数据集的最小信息散度方法提出最优策略函数的估计量。特别地,我们讨论了 γ\gamma-幂散度,其被证明具有一个有利性质:策略等价的Q函数之间的 γ\gamma-幂散度为零。该性质本质上用于寻找最优策略,这在一个针对Q函数的半参数模型框架中讨论。幂指数 γ\gamma 的特定选择给出了值函数以及Q函数的几何平均与调和平均的有趣关系。数值实验展示了最小 γ\gamma-幂散度方法在动态治疗策略背景下的性能。

关键词

引用

@article{arxiv.2211.08741,
  title  = {Minimum information divergence of Q-functions for dynamic treatment resumes},
  author = {Shinto Eguchi},
  journal= {arXiv preprint arXiv:2211.08741},
  year   = {2022}
}

备注

22 pages