中文

基于凝聚力的在线Actor-Critic强化学习用于移动健康干预

机器学习 2017-08-25 v2

摘要

随着全球智能设备用户的庞大群体,移动健康(mHealth)技术有望对人们的健康产生积极而广泛的影响。它们能够为设备用户提供灵活、可负担且便携的健康指导。当前用于mHealth的在线决策方法假设用户完全异质。它们不在用户间共享信息,并为每个用户学习单独的策略。然而,每个用户的数据量非常有限,不足以支持单独的在线学习,导致包含大量方差的不稳定策略。此外,我们发现事实是用户可能与部分(而非全部)用户相似,且相连用户往往具有相似行为。在本文中,我们提出了一种用于mHealth的网络凝聚力约束的(actor-critic)强化学习(RL)方法。目标是探索如何在相似用户间共享信息,以更好地将有限的用户信息转化为更精确的学习策略。据我们所知,这是首个用于mHealth的在线actor-critic RL,也是所有应用中首个网络凝聚力约束的(actor-critic) RL方法。网络凝聚力对于推导有效策略十分重要。我们提出了一种新方法,通过使用直接反映用户属性的热启动轨迹(warm start trajectory)来学习网络。由于我们模型的价值间接观测,其优化困难且不同于一般的监督学习。作为贡献,我们为所提出的在线RL提出了两种算法。除mHealth外,所提方法可轻松应用或调整到其他健康相关任务。在HeartSteps数据集上的大量实验结果表明,在多种参数设置下,所提两种方法相比最先进方法获得了明显改进。

关键词

引用

@article{arxiv.1703.10039,
  title  = {Cohesion-based Online Actor-Critic Reinforcement Learning for mHealth Intervention},
  author = {Feiyun Zhu and Peng Liao and Xinliang Zhu and Yaowen Yao and Junzhou Huang},
  journal= {arXiv preprint arXiv:1703.10039},
  year   = {2017}
}