中文

用于个性化移动健康干预的Actor-Critic上下文_bandit算法

机器学习 2022-04-26 v2 机器学习

摘要

日益增长的技术复杂性和智能手机及可穿戴设备的广泛使用,为创新且高度个性化的健康干预提供了机会。即时自适应干预(JITAI)利用现代移动设备的实时数据收集和通信能力,提供适应用户当下需求的实时干预。尽管JITAI在临床科学家中日益流行,但在构建基于数据的JITAI方面缺乏方法学指导仍是推进JITAI研究的障碍。在本文中,我们首次尝试通过将实时定制干预的任务表述为上下文_bandit问题来弥补这一方法学差距。移动健康领域的可解释性要求使我们以不同于现有面向网页应用(如广告或新闻文章放置)的表述方式来表述该问题。在线性奖励函数假设下,我们将奖励函数(“评论家”)的参数化与随机策略(“行动者”)的较低维参数化分开选择。我们提供了一种在线actor-critic算法,指导JITAI的构建与精炼。该actor-critic算法的渐近性质被推导出来并得到数值实验的支持。还进行了额外的数值实验,以在违反上下文_bandit算法分析中使用的理想化假设时测试该算法的鲁棒性。

关键词

引用

@article{arxiv.1706.09090,
  title  = {An Actor-Critic Contextual Bandit Algorithm for Personalized Mobile Health Interventions},
  author = {Huitian Lei and Yangyi Lu and Ambuj Tewari and Susan A. Murphy},
  journal= {arXiv preprint arXiv:1706.09090},
  year   = {2022}
}

备注

The theoretical analyses in this version are stronger compared to the previous one. This manuscript is not intended for publication