在 Bandit 环境中学习模块化安全策略及其在自适应临床试验中的应用
机器学习
2019-06-11 v3 人工智能
机器学习
摘要
随机多臂老虎机问题是研究探索-利用权衡的一个著名模型。它在自适应临床试验中具有重要的潜在应用,允许对患者治疗分配概率进行动态改变。然而,大多数老虎机学习算法的设计目标是最小化期望遗憾。虽然这种方法在许多领域很有用,但在临床试验中,它可能对异常数据敏感,尤其是在样本量较小的情况下。在本文中,我们定义并研究了一个新的老虎机问题鲁棒性准则。具体而言,我们考虑将收益分布的函数优化作为遗憾度量。这为从业者定义适当的遗憾度量提供了更大的灵活性。我们为解决此类问题而提出的学习算法是 BESA 算法 [Baransi et al., 2014] 的修改版本,它考虑了更一般意义上的遗憾。我们给出了所提方法的遗憾界限,并在合成问题以及来自临床试验文献的数据集上对其进行了实证评估。我们的方法与一套标准老虎机算法相比表现良好。
引用
@article{arxiv.1903.01026,
title = {Learning Modular Safe Policies in the Bandit Setting with Application to Adaptive Clinical Trials},
author = {Hossein Aboutalebi and Doina Precup and Tibor Schuster},
journal= {arXiv preprint arXiv:1903.01026},
year = {2019}
}