中文

面向移动健康干预的鲁棒行动者-评论家上下文老虎机

机器学习 2018-02-28 v1

摘要

我们考虑用于移动健康(mHealth)干预的行动者-评论家上下文老虎机。最先进的决策算法通常忽略数据集中的离群值。在本文中,我们提出了一种用于mHealth的新型鲁棒上下文老虎机方法。它能够实现在减少离群值影响的同时,寻求与在无离群值数据集上最先进上下文老虎机方法相似解的冲突目标。这种性能依赖于两项技术:(1)封顶-2\ell_{2}范数;(2)一种受统计学中最基本技术之一启发的设定阈值超参数的可靠方法。尽管模型非凸且不可微,我们提出了一种有效的重加权算法并提供了坚实的理论分析。我们证明所提算法在每次迭代后能找到充分下降的点,并在有限次迭代后最终收敛。在两个数据集上的大量实验结果表明,我们的方法在无离群值数据集上能与最先进上下文老虎机方法取得几乎相同的结果,并在多种参数设置下显著优于那些在含离群值的严重噪声数据集上的最先进方法。

关键词

引用

@article{arxiv.1802.09714,
  title  = {Robust Actor-Critic Contextual Bandit for Mobile Health (mHealth) Interventions},
  author = {Feiyun Zhu and Jun Guo and Ruoyu Li and Junzhou Huang},
  journal= {arXiv preprint arXiv:1802.09714},
  year   = {2018}
}