中文

面向行为健康中个性化干预的策略优化

机器学习 2024-07-19 v3 人工智能

摘要

通过数字平台提供的行为健康干预,有潜力通过教育、激励、提醒和外联显著改善健康结果。我们研究优化患者个性化干预以最大化长期结果的问题,其中干预成本高且容量受限。我们假设可访问来自初始试点研究的历史数据集。我们提出一种称为 DecompPI 的新方法来解决该问题,它将患者系统的状态空间分解到个体层面,然后近似一步策略迭代。实现 DecompPI 仅需使用该数据集执行一个预测任务,从而免除了在线实验的需要。DecompPI 是一种通用的无模型算法,无论底层患者行为模型如何均可使用。我们在一个具代表性的简单特例模型上推导了理论保证。当用于收集数据的初始策略是随机化时,我们建立了 DecompPI 相对于不分配干预的空策略所带来改进的近似保证。我们表明该保证对估计误差具有鲁棒性。随后我们使用来自移动健康平台、用于改善结核病治疗依从性的真实世界数据进行了严格的实证案例研究。利用经验证的仿真模型,我们证明 DecompPI 可用约一半的干预容量提供与现状方法相同的疗效。DecompPI 对于旨在通过针对性干预改善长期行为的机构而言简单易实现,本文从理论和实证上均展示了其强劲性能,尤其在资源有限环境中。

关键词

引用

@article{arxiv.2303.12206,
  title  = {Policy Optimization for Personalized Interventions in Behavioral Health},
  author = {Jackie Baek and Justin J. Boutilier and Vivek F. Farias and Jonas Oddur Jonasson and Erez Yoeli},
  journal= {arXiv preprint arXiv:2303.12206},
  year   = {2024}
}