RoME:用于优化移动健康干预的鲁棒混合效应Bandit算法
机器学习
2025-01-16 v4 机器学习
摘要
移动健康利用通过Bandit和强化学习算法优化的个性化和情境化干预措施。然而在实践中,参与者异质性、非平稳性和非线性关系等挑战阻碍了算法的性能。我们提出了RoME,一种鲁棒混合效应上下文Bandit算法,该算法通过以下方式同时应对这些挑战:(1) 使用用户和时间特定的随机效应建模差分奖励,(2) 网络凝聚力惩罚,以及 (3) 用于灵活估计基线奖励的去偏机器学习。我们建立了一个仅依赖于差分奖励模型维度的高概率遗憾界,使我们即使在基线奖励高度复杂的情况下也能获得鲁棒的遗憾界。我们在一项模拟和两项离线策略评估研究中展示了RoME算法的卓越性能。
引用
@article{arxiv.2312.06403,
title = {RoME: A Robust Mixed-Effects Bandit Algorithm for Optimizing Mobile Health Interventions},
author = {Easton K. Huch and Jieru Shi and Madeline R. Abbott and Jessica R. Golbus and Alexander Moreno and Walter H. Dempsey},
journal= {arXiv preprint arXiv:2312.06403},
year = {2025}
}