无限时间域上个体化治疗策略的策略学习
统计方法学
2023-09-26 v1
摘要
随着近期技术在实时监测与数据收集方面的进步,“即时”干预可通过移动设备交付,以实现实时与长期的管理和控制。强化学习将此类移动干预形式化为一系列决策规则,并根据用户在每一决策点的状态分配治疗臂。在实践中,真实应用关注大量决策点,超出当前所收集数据的时间范围。这通常指无限时间域设定下的强化学习,其挑战性要大得多。本文对该主题的一些统计方法学进行了选择性综述。我们讨论了它们的建模框架、可泛化性与可解释性,并给出了一些用例示例。文末讨论了若干未来研究方向。
引用
@article{arxiv.2309.13458,
title = {Policy Learning for Individualized Treatment Regimes on Infinite Time Horizon},
author = {Wenzhuo Zhou and Yuhan Li and Ruoqing Zhu},
journal= {arXiv preprint arXiv:2309.13458},
year = {2023}
}