中文

RoME:用于优化移动健康干预的鲁棒混合效应Bandit算法

机器学习 2025-01-16 v4 机器学习

摘要

移动健康利用通过Bandit和强化学习算法优化的个性化和情境化干预措施。然而在实践中,参与者异质性、非平稳性和非线性关系等挑战阻碍了算法的性能。我们提出了RoME,一种鲁棒混合效应上下文Bandit算法,该算法通过以下方式同时应对这些挑战:(1) 使用用户和时间特定的随机效应建模差分奖励,(2) 网络凝聚力惩罚,以及 (3) 用于灵活估计基线奖励的去偏机器学习。我们建立了一个仅依赖于差分奖励模型维度的高概率遗憾界,使我们即使在基线奖励高度复杂的情况下也能获得鲁棒的遗憾界。我们在一项模拟和两项离线策略评估研究中展示了RoME算法的卓越性能。

关键词

引用

@article{arxiv.2312.06403,
  title  = {RoME: A Robust Mixed-Effects Bandit Algorithm for Optimizing Mobile Health Interventions},
  author = {Easton K. Huch and Jieru Shi and Madeline R. Abbott and Jessica R. Golbus and Alexander Moreno and Walter H. Dempsey},
  journal= {arXiv preprint arXiv:2312.06403},
  year   = {2025}
}