中文

无限时间域上个体化治疗策略的策略学习

统计方法学 2023-09-26 v1

摘要

随着近期技术在实时监测与数据收集方面的进步,“即时”干预可通过移动设备交付,以实现实时与长期的管理和控制。强化学习将此类移动干预形式化为一系列决策规则,并根据用户在每一决策点的状态分配治疗臂。在实践中,真实应用关注大量决策点,超出当前所收集数据的时间范围。这通常指无限时间域设定下的强化学习,其挑战性要大得多。本文对该主题的一些统计方法学进行了选择性综述。我们讨论了它们的建模框架、可泛化性与可解释性,并给出了一些用例示例。文末讨论了若干未来研究方向。

关键词

引用

@article{arxiv.2309.13458,
  title  = {Policy Learning for Individualized Treatment Regimes on Infinite Time Horizon},
  author = {Wenzhuo Zhou and Yuhan Li and Ruoqing Zhu},
  journal= {arXiv preprint arXiv:2309.13458},
  year   = {2023}
}