中文

reBandit: 基于随机效应的在线强化学习算法用于减少大麻使用

人工智能 2024-06-12 v2 机器学习

摘要

大麻使用及相关的大麻使用障碍(CUD)的日益流行,对全球公共卫生构成了重大挑战。由于治疗缺口尤其显著,特别是在新兴成年人(EA;18-25岁)中,解决大麻使用和CUD仍然是2030年联合国可持续发展目标(SDG)中的关键目标。在这项工作中,我们开发了一种名为reBandit的在线强化学习(RL)算法,该算法将用于一项移动健康研究,以提供旨在减少EA中大麻使用的个性化移动健康干预。reBandit利用随机效应和信息性贝叶斯先验,在嘈杂的移动健康环境中快速高效地学习。此外,reBandit采用经验贝叶斯和优化技术在线自动更新其超参数。为了评估我们算法的性能,我们使用先前研究的数据构建了一个模拟测试平台,并与移动健康研究中常用的算法进行了比较。我们表明,reBandit的表现与所有基线算法相当或更好,并且随着模拟环境中群体异质性的增加,性能差距扩大,证明了其适应多样化研究参与者群体的能力。

关键词

引用

@article{arxiv.2402.17739,
  title  = {reBandit: Random Effects based Online RL algorithm for Reducing Cannabis Use},
  author = {Susobhan Ghosh and Yongyi Guo and Pei-Yao Hung and Lara Coughlin and Erin Bonar and Inbal Nahum-Shani and Maureen Walton and Susan Murphy},
  journal= {arXiv preprint arXiv:2402.17739},
  year   = {2024}
}